中文

VisionCreator-R1:一种具反思增强的原生视觉生成代理模型

计算机视觉与模式识别 2026-03-11 v1

摘要

视觉内容生成从单图像向多图像工作流程发展,然而现有代理模型仍多为计划驱动式,缺乏纠正轨迹中视觉错误的系统性反思机制。为此,我们提出 VisionCreator-R1,一种具显式反思能力的原生视觉生成代理模型,辅以反思-计划联合优化(Reflection-Plan Co-Optimization, RPCO)训练方法。通过大量实验与轨迹层面分析,我们发现强化学习中反思-计划优化存在不对称性:计划可通过计划奖励可靠优化,而反思学习则因信用分配噪声受阻。基于此洞见,RPCO 首先在自构建的 VCR-SFT 数据集上进行训练,包含反思强烈的单图像轨迹与计划强烈的多图像轨迹;随后在 VCR-RL 数据集上进行联合优化,形成我们的统一 VisionCreator-R1 代理模型。该模型在现有基准及覆盖单/多图像任务的 VCR-bench 上均持续超越 Gemini2.5Pro。

关键词

引用

@article{arxiv.2603.08812,
  title  = {VisionCreator-R1: A Reflection-Enhanced Native Visual-Generation Agentic Model},
  author = {Jinxiang Lai and Wenzhe Zhao and Zexin Lu and Hualei Zhang and Qinyu Yang and Rongwei Quan and Zhimin Li and Shuai Shao and Song Guo and Qinglin Lu},
  journal= {arXiv preprint arXiv:2603.08812},
  year   = {2026}
}