MM-ReCoder:通过强化学习与自纠错推进图表到代码生成
人工智能
2026-04-03 v1
摘要
多模态大语言模型(MLLM)最近在图表到代码生成等多模态编码任务中展示了有前景的能力。然而,现有方法主要依赖监督微调(SFT),这要求模型通过图表-代码对学习代码模式,但不会使模型接触到代码执行环境。此外,虽然通过执行反馈的自纠错为提高编码质量提供了一条潜在途径,但即使是最先进的MLLM也已被证明在有效自纠错方面存在困难。在这项工作中,我们引入了MM-ReCoder,一个通过强化学习(RL)训练并配备自纠错能力的图表到代码生成模型。我们提出了一种基于组相对策略优化(GRPO)的两阶段多轮自纠错RL策略。第一阶段通过展开共享的第一轮来增强模型的自纠错能力,而第二阶段通过完整轨迹优化来提高编码能力。MM-ReCoder通过与环境的交互以及迭代纠正自身输出来学习生成更准确和可执行的代码。我们在三个图表到代码基准上的结果展示了MM-ReCoder的最先进性能。
引用
@article{arxiv.2604.01600,
title = {MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction},
author = {Zitian Tang and Xu Zhang and Jianbo Yuan and Yang Zou and Varad Gunjal and Songyao Jiang and Davide Modolo},
journal= {arXiv preprint arXiv:2604.01600},
year = {2026}
}
备注
CVPR 2026