基于双自一致性强化学习的科学图形程序合成
计算机视觉与模式识别
2026-04-08 v1 人工智能
摘要
图形程序合成对于解读和编辑视觉数据至关重要,能够有效地将静态视觉图像逆向工程为可编辑的TikZ代码。虽然TikZ因其程序化灵活性已成为科学示意图的事实标准,但其对严格空间精度的要求对多模态大语言模型构成了重大挑战。目前的进展受到两个主要差距的制约:(1) 数据质量差距:现有的图像-TikZ语料库往往缺乏严格的执行性和可靠的视觉对齐;(2) 评估差距:缺乏同时涵盖结构保真度和视觉保真度的基准。为了解决这些问题,我们提出了一个闭环框架,包含:SciTikZ-230K,一个来自我们以执行为中心的数据引擎的大规模高质量数据集,涵盖11个不同的科学学科;SciTikZ-Bench,一个多方面的基准,从基本几何构造到复杂的层次化示意图,用于评估视觉保真度和结构逻辑。为了进一步拓宽视觉-代码优化方法的范围,我们引入了一种新颖的双自一致性强化学习优化范式,该范式利用往返验证来惩罚退化代码并提升整体自一致性。借助这些,我们的训练模型SciTikZer-8B达到了最先进的性能,持续超越专有巨头模型如Gemini-2.5-Pro和大型模型如Qwen3-VL-235B-A22B-Instruct。
引用
@article{arxiv.2604.06079,
title = {Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning},
author = {Juekai Lin and Yun Zhu and Honglin Lin and Sijing Li and Tianwei Lin and Zheng Liu and Xiaoyang Wang and Wenqiao Zhang and Lijun Wu},
journal= {arXiv preprint arXiv:2604.06079},
year = {2026}
}