MIMO智商详情
每日心跳测试:03:05、08:05、11:05、13:05、16:05;每周基准测试:周日 03:00(北京时间)
01
不同模型的完整表现
筛选组合
若显示不全,请左右滑动
| 组合 | IQ | 答错 | 失败 | 成本 | 耗时 | 趋势 |
|---|---|---|---|---|---|---|
| mimo-v2.5-pro推理-关Plan,国际 | 92
| 8.0% | 0.0% | ¥0.1 | 3s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5-pro推理-关按量,国际 | 90
| 8.1% | 0.0% | ¥0.1 | 5s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5-pro推理-开Plan,国际 | 90
| 10.5% | 0.0% | ¥0.3 | 12s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5推理-关Plan,中国 | 90
| 9.9% | 0.0% | ¥0.0 | 2s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5-pro推理-关Plan,中国 | 89
| 11.6% | 0.0% | ¥0.1 | 3s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5推理-开Plan,中国 | 89
| 10.1% | 1.3% | ¥0.1 | 11s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5推理-开按量,国际 | 89
| 11.7% | 0.0% | ¥0.1 | 13s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5推理-关按量,国际 | 89
| 11.4% | 0.0% | ¥0.0 | 4s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5推理-开Plan,国际 | 88
| 11.8% | 0.0% | ¥0.1 | 12s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5推理-关Plan,国际 | 88
| 9.8% | 0.0% | ¥0.0 | 4s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5推理-关按量,中国 | 88
| 10.6% | 0.0% | ¥0.0 | 4s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5-pro推理-开按量,中国 | 88
| 11.3% | 0.0% | ¥0.3 | 13s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5-pro推理-开Plan,中国 | 87
| 12.1% | 0.0% | ¥0.3 | 14s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5-pro推理-开按量,国际 | 86
| 12.7% | 0.0% | ¥0.3 | 13s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5-pro推理-关按量,中国 | 86
| 12.6% | 0.0% | ¥0.1 | 4s | 同比数据缺失 / 环比智商表现稳定 |
| mimo-v2.5推理-开按量,中国 | 83
| 15.9% | 0.0% | ¥0.1 | 14s | 同比数据缺失 / 环比智商表现稳定 |
02
测评方法
智商定义:综合衡量推理、代码、长文档理解、中文表达和稳定性,不把单次问答体感当作结论。
题库设计:每组使用同一套 80 题正式题库,覆盖高难数学、代码、中文复杂理解、长上下文、复杂指令执行和实用场景推理。
裁判方法:客观题自动判分,开放题交给外部非 MiMO 裁判模型评分,再汇总为组合级公开摘要。
题库说明
| 题型 | 数量 | 题源 | 题库设计 | 判分方式 |
|---|---|---|---|---|
| 高难数学推理 | 20 | math_500、AIME 24/25/26 | 高难数学、竞赛推理和精确答案。 | 客观答案自动判分 |
| 代码能力 | 20 | humaneval_plus、mbpp_plus、bigcodebench | 生成、修改、排错和测试用例通过情况。 | 测试用例 / 规则自动判分 |
| 中文复杂理解 | 15 | ceval-hard、cmmlu-hard、chinese_simpleqa | 复杂中文理解、常识问答和表达准确性。 | 客观答案与参考答案判分 |
| 长上下文 | 10 | needle_haystack、longbench_v2 | 跨段检索、抓重点和引用一致性。 | 检索命中与一致性判分 |
| 复杂指令执行 | 10 | ifeval-hard、自建格式约束题 | 严格格式、步骤约束和结构化输出。 | 格式规则与裁判模型判分 |
| 实用场景推理 | 5 | 自建真实使用约束题 | 限流、计费、成本和失败原因判断。 | 选择题自动判分 / 短答裁判评分 |
高难数学推理20 题
高难数学、竞赛推理和精确答案。
题源:math_500、AIME 24/25/26代码能力20 题
生成、修改、排错和测试用例通过情况。
题源:humaneval_plus、mbpp_plus、bigcodebench中文复杂理解15 题
复杂中文理解、常识问答和表达准确性。
题源:ceval-hard、cmmlu-hard、chinese_simpleqa长上下文10 题
跨段检索、抓重点和引用一致性。
题源:needle_haystack、longbench_v2复杂指令执行10 题
严格格式、步骤约束和结构化输出。
题源:ifeval-hard、自建格式约束题实用场景推理5 题
限流、计费、成本和失败原因判断。
题源:自建真实使用约束题