中文

GeoSym127K:面向多模态几何推理的可规模符号验证合成

计算机视觉与模式识别 2026-05-19 v1 人工智能

摘要

大型多模态模型 (LMM) 常因视觉幻觉缺乏数学精确的链式思维 (Chain-of-Thought, CoT) 数据而在几何推理中受限。为此,我们提出 GeoSym Engine,一个自动化且可规模的神经符号框架。我们利用类型条件语法和分析性 SymGT 求解器,推导出 exact 符号真实值,并无缝集成到稳健的渲染管道中,以产生高精度几何图。运用该引擎,我们构建 GeoSym127K,一个难度分层数据集,包含 51K 高分辨率图像、127K 个带符号真实值的问题、55K 个经验证的 CoT QA 对。我们还引入 GeoSym-Bench,一个由专家精选的 511 个复杂样本构成的严格评估套件。通过大量监督微调 (SFT),我们证明 GeoSym 在图依赖和多步骤几何任务中实现了集中性改进。我们的 Qwen3-VL-8B 模型在 MathVerse Vision-Only 子集上获得绝对 +22.21% 的提升,并在 WeMath 上达到 61.52%(+6.19% 的改进),缓解了长期逻辑碎片化问题,超越了如豆包 1.8 等先进闭源模型。此外,通过通过 GRPO 实现的可验证奖励强化学习 (RLVR) 发现,初始化自结构 SFT 检查点可显著提升零样 RL 性能上限。驱动于确定性精确匹配信号,这展示了我们可验证推理合成的稳健规模潜力。数据集和代码已在 https://huggingface.co/datasets/Tomie0506/GeoSym127K 和 https://github.com/Tomie56/GeoSym127K 提供。

关键词

引用

@article{arxiv.2605.16371,
  title  = {GeoSym127K: Scalable Symbolically-verifiable Synthesis for Multimodal Geometric Reasoning},
  author = {Jinhao Jing and Zheng Ma and Jinwei Liang and Qiannian Zhao and Shawn Chen and Jing Yang and Por Lip Yee and Prayag Tiwari and Jingjing Bai and Benyou Wang and Lewei Lu and Zhan Su},
  journal= {arXiv preprint arXiv:2605.16371},
  year   = {2026}
}