CMMaTH:面向基础模型中文多模态数学技能评估基准
计算与语言
2024-07-18 v1 人工智能
摘要
随着多模态大型语言模型的快速发展,评估其多模态数学能力受到广泛关注。尽管像 MathVista 这样的数据集已提出了用于评估多模态场景下数学能力的基准测试,但仍缺乏针对 K12 教育中文语境下细粒度评估的相应工具和数据集。为系统评估多模态大型模型在解决中文多模态数学问题方面的能力,我们提出了中文多模态数学技能评估基准,命名为 CMMaTH,包含 23 万个多模态 K12 数学相关问题,目前规模最大的中文多模态数学问题基准。CMMaTH 的问题涵盖小学至高中阶段,提供了问题类型的多样性、解答目标的多样性、视觉元素的丰富性、详尽的知识点以及标准的解答标注。我们构建了一个集成 CMMaTH 数据集的开源工具 GradeGPT,便于模型评估的稳定、快速且免费进行。我们的数据和代码均已公开。
引用
@article{arxiv.2407.12023,
title = {CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models},
author = {Zhong-Zhi Li and Ming-Liang Zhang and Fei Yin and Zhi-Long Ji and Jin-Feng Bai and Zhen-Ru Pan and Fan-Hu Zeng and Jian Xu and Jia-Xin Zhang and Cheng-Lin Liu},
journal= {arXiv preprint arXiv:2407.12023},
year = {2024}
}