中文

MathGen:通过文本到图像生成揭示数学能力的幻象

计算机视觉与模式识别 2026-04-01 v2

摘要

现代生成模型已展示出解决具有挑战性数学问题的能力。在许多实际场景中,数学解答必须通过图表、图形、几何构图及结构化符号布局等可视化形式表达,正确性依赖于精确的视觉组合。这自然引出一个问题:当答案必须以视觉方式呈现时,生成模型是否仍具备此类能力?为此,我们引入 MathGen,一个包含 900 题、覆盖七大核心领域的严格基准测试,配合基于“脚本即裁判”(Script-as-a-Judge)协议的可执行验证器,实现确定性、客观的评估。实验表明,数学保真性仍是主要瓶颈:即便是最佳闭源模型也仅达到 42.0% 的总体准确率,而开源模型仅实现约 1%--11%,在结构化任务中常接近 0%。总体而言,当前文本到图像模型在甚至最基础的数学视觉生成任务上仍远不够成熟。

关键词

引用

@article{arxiv.2603.27959,
  title  = {MathGen: Revealing the Illusion of Mathematical Competence through Text-to-Image Generation},
  author = {Ruiyao Liu and Hui Shen and Ping Zhang and Yunta Hsieh and Yifan Zhang and Jing Xu and Sicheng Chen and Junchen Li and Jiawei Lu and Jianing Ma and Jiaqi Mo and Qi Han and Zhen Zhang and Zhongwei Wan and Jing Xiong and Xin Wang and Ziyuan Liu and Hangrui Cao and Ngai Wong},
  journal= {arXiv preprint arXiv:2603.27959},
  year   = {2026}
}