中文

通过 多任务 多奖励 强化学习 实现 SVG-LLM 可靠推理

计算机视觉与模式识别 2026-03-18 v1

摘要

随着视觉语言模型的快速发展,越来越多的研究探索了其在 SVG 生成任务中的潜力。虽然现有方法通过构建大规模 SVG 数据集和引入 SVG 特定标记来提升性能,但仍存在泛化受限、代码输出中冗余路径以及缺乏显式推理等问题。本文提出 CTRL-S (Chain-of-Thought Reinforcement Learning for SVG),一个统一框架,引入链式思考机制以在 SVG 生成期间显式暴露模型的推理过程。为支持这种结构化推理,我们构建了 SVG-Sophia 数据集,包含 145K 样本,覆盖 SVG 代码精炼、Text-to-SVG 和 Image-to-SVG 三个任务。通过训练模型生成组级结构化 SVG 代码,CTRL-S显著提高了结构一致性和视觉保真度。进一步,我们采用 GRPO 算法并设计多奖励优化框架,集成 DINO、图像文本相似性、格式和代码效率奖励。通过联合多奖励优化和多任务训练,我们的方法系统性地提升了整体生成能力。大量实验表明,CTRL-S 超过现有方法,实现更高的任务成功率、更优的 SVG 代码质量和卓越的视觉保真度。

关键词

引用

@article{arxiv.2603.16189,
  title  = {Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning},
  author = {Haomin Wang and Qi Wei and Qianli Ma and Shengyuan Ding and Jinhui Yin and Kai Chen and Hongjie Zhang},
  journal= {arXiv preprint arXiv:2603.16189},
  year   = {2026}
}