中文

OmniDiagram:通过视觉询问奖励推进统一图表代码生成

人工智能 2026-04-08 v1

摘要

可编程图表生成的范式正在快速发展,在结构化可视化中发挥着关键作用。然而,大多数现有研究局限于狭窄的任务形式化和语言支持,限制了其对多样化图表类型的适用性。在本工作中,我们提出了 OmniDiagram,一个统一框架,整合了多样化的图表代码语言和任务定义。为解决强化学习(RL)中代码逻辑与视觉保真度对齐的挑战,我们引入了一种名为视觉询问验证全部(\textsc{Viva})的新型视觉反馈策略。与脆弱的基于语法的规则或像素级匹配不同,\textsc{Viva} 通过生成式方法奖励渲染图表的视觉结构。具体而言,\textsc{Viva} 主动生成针对性的视觉询问来审查图表视觉保真度,并提供细粒度反馈以优化。该机制促进了自我演化的训练过程,有效消除了对人工标注真实代码的需求。此外,我们构建了 M32^2Diagram,第一个大规模图表代码生成数据集,包含超过 196k 个高质量样本。实验结果证实,SFT 与基于 \textsc{Viva} 的 RL 的结合使 OmniDiagram 在图表代码生成基准测试中建立了新的最先进(SOTA)水平。

关键词

引用

@article{arxiv.2604.05514,
  title  = {OmniDiagram: Advancing Unified Diagram Code Generation via Visual Interrogation Reward},
  author = {Haoyue Yang and Xuanle Zhao and Xuexin Liu and Feibang Jiang and Yao Zhu},
  journal= {arXiv preprint arXiv:2604.05514},
  year   = {2026}
}

备注

Accepted to ACL 2026 Findings