中文

通用几何图像标题合成

人工智能 2025-09-19 v1 计算机视觉与模式识别 机器学习

摘要

多模态大语言模型在各种实际应用中需要强大的推理能力。尽管近期取得了进展,但这些模型仍然在解决复杂几何问题方面存在挑战。一个关键挑战源于缺乏用于理解几何图像的高质量图像-文本配对数据集。此外,大多数基于模板的数据合成管道通常无法泛化到其预定义模板之外的问题。在本文中,我们在数据生成管道中引入了一种补充过程,即利用可验证奖励的强化学习 (RLVR)。通过采用RLVR来优化来自50种基本几何关系合成的几何图像的标题,并利用数学问题解决任务派生的奖励信号,我们的管道成功地捕捉了几何问题解决的关键特征。这使得更好的任务泛化并取得显著性的改进。此外,即使在超出分布的情况下,生成的数据集也能增强多模态大语言模型的通用推理能力,在MathVista和MathVerse的非几何输入图像的统计、算术、代数和数值任务中实现 2.8%2.8\%-4.8%4.8\% 的准确率提升,在MMMU的艺术、设计、技术和工程任务中实现 2.4%2.4\%-3.9%3.9\% 的提升。

关键词

引用

@article{arxiv.2509.15217,
  title  = {Generalizable Geometric Image Caption Synthesis},
  author = {Yue Xin and Wenyuan Wang and Rui Pan and Ruida Wang and Howard Meng and Renjie Pi and Shizhe Diao and Tong Zhang},
  journal= {arXiv preprint arXiv:2509.15217},
  year   = {2025}
}