MIMO智商详情

每日心跳测试:03:05、08:05、11:05、13:05、16:05;每周基准测试:周日 03:00(北京时间)

01

不同模型的完整表现

筛选组合

若显示不全,请左右滑动

组合IQ答错失败成本耗时趋势
mimo-v2.5-pro推理-关Plan,国际
92
推理
90
代码
97
长上下文
84
中文
94
稳定性
95
8.0%0.0%¥0.13s同比数据缺失 / 环比智商表现稳定
mimo-v2.5-pro推理-关按量,国际
90
推理
93
代码
97
长上下文
83
中文
94
稳定性
84
8.1%0.0%¥0.15s同比数据缺失 / 环比智商表现稳定
mimo-v2.5-pro推理-开Plan,国际
90
推理
84
代码
97
长上下文
83
中文
92
稳定性
93
10.5%0.0%¥0.312s同比数据缺失 / 环比智商表现稳定
mimo-v2.5推理-关Plan,中国
90
推理
86
代码
96
长上下文
74
中文
94
稳定性
98
9.9%0.0%¥0.02s同比数据缺失 / 环比智商表现稳定
mimo-v2.5-pro推理-关Plan,中国
89
推理
79
代码
97
长上下文
79
中文
94
稳定性
97
11.6%0.0%¥0.13s同比数据缺失 / 环比智商表现稳定
mimo-v2.5推理-开Plan,中国
89
推理
87
代码
96
长上下文
80
中文
95
稳定性
87
10.1%1.3%¥0.111s同比数据缺失 / 环比智商表现稳定
mimo-v2.5推理-开按量,国际
89
推理
78
代码
98
长上下文
86
中文
93
稳定性
89
11.7%0.0%¥0.113s同比数据缺失 / 环比智商表现稳定
mimo-v2.5推理-关按量,国际
89
推理
82
代码
97
长上下文
79
中文
91
稳定性
96
11.4%0.0%¥0.04s同比数据缺失 / 环比智商表现稳定
mimo-v2.5推理-开Plan,国际
88
推理
81
代码
98
长上下文
78
中文
92
稳定性
93
11.8%0.0%¥0.112s同比数据缺失 / 环比智商表现稳定
mimo-v2.5推理-关Plan,国际
88
推理
92
代码
97
长上下文
73
中文
93
稳定性
88
9.8%0.0%¥0.04s同比数据缺失 / 环比智商表现稳定
mimo-v2.5推理-关按量,中国
88
推理
87
代码
97
长上下文
80
中文
93
稳定性
84
10.6%0.0%¥0.04s同比数据缺失 / 环比智商表现稳定
mimo-v2.5-pro推理-开按量,中国
88
推理
85
代码
97
长上下文
85
中文
93
稳定性
79
11.3%0.0%¥0.313s同比数据缺失 / 环比智商表现稳定
mimo-v2.5-pro推理-开Plan,中国
87
推理
81
代码
98
长上下文
81
中文
93
稳定性
84
12.1%0.0%¥0.314s同比数据缺失 / 环比智商表现稳定
mimo-v2.5-pro推理-开按量,国际
86
推理
82
代码
97
长上下文
80
中文
95
稳定性
78
12.7%0.0%¥0.313s同比数据缺失 / 环比智商表现稳定
mimo-v2.5-pro推理-关按量,中国
86
推理
84
代码
97
长上下文
76
中文
91
稳定性
83
12.6%0.0%¥0.14s同比数据缺失 / 环比智商表现稳定
mimo-v2.5推理-开按量,中国
83
推理
77
代码
98
长上下文
75
中文
91
稳定性
75
15.9%0.0%¥0.114s同比数据缺失 / 环比智商表现稳定
02

测评方法

智商定义:综合衡量推理、代码、长文档理解、中文表达和稳定性,不把单次问答体感当作结论。

题库设计:每组使用同一套 80 题正式题库,覆盖高难数学、代码、中文复杂理解、长上下文、复杂指令执行和实用场景推理。

裁判方法:客观题自动判分,开放题交给外部非 MiMO 裁判模型评分,再汇总为组合级公开摘要。

题库说明

题型数量题源题库设计判分方式
高难数学推理20math_500、AIME 24/25/26高难数学、竞赛推理和精确答案。客观答案自动判分
代码能力20humaneval_plus、mbpp_plus、bigcodebench生成、修改、排错和测试用例通过情况。测试用例 / 规则自动判分
中文复杂理解15ceval-hard、cmmlu-hard、chinese_simpleqa复杂中文理解、常识问答和表达准确性。客观答案与参考答案判分
长上下文10needle_haystack、longbench_v2跨段检索、抓重点和引用一致性。检索命中与一致性判分
复杂指令执行10ifeval-hard、自建格式约束题严格格式、步骤约束和结构化输出。格式规则与裁判模型判分
实用场景推理5自建真实使用约束题限流、计费、成本和失败原因判断。选择题自动判分 / 短答裁判评分
高难数学推理20

高难数学、竞赛推理和精确答案。

题源:math_500、AIME 24/25/26
代码能力20

生成、修改、排错和测试用例通过情况。

题源:humaneval_plus、mbpp_plus、bigcodebench
中文复杂理解15

复杂中文理解、常识问答和表达准确性。

题源:ceval-hard、cmmlu-hard、chinese_simpleqa
长上下文10

跨段检索、抓重点和引用一致性。

题源:needle_haystack、longbench_v2
复杂指令执行10

严格格式、步骤约束和结构化输出。

题源:ifeval-hard、自建格式约束题
实用场景推理5

限流、计费、成本和失败原因判断。

题源:自建真实使用约束题