多家高校联合发布的中文多模态评测基准 CMMU-Eval 覆盖 12 个头部模型、5 大任务域。核心结论:
关键发现
- 文档理解:Qwen-VL 与 GLM-4V 在中文版面理解上领先 GPT-5.2 约 4 个百分点,方言手写体优势更大。
- 视频理解:所有模型的长视频问答准确率均低于 60%,是公认短板。
- 图表推理:闭源模型整体领先,但差距在缩小。
- 文化语境:成语、网络用语等文化负载内容上,国产模型优势压倒性。
对开发者的建议
文档密集型业务(票据、合同、档案)可以放心选用国产开源模型;视频理解相关需求建议做好人工兜底设计。
该基准已全部开源,支持一键复现。