VisionCreator-R1:一种具反思增强的原生视觉生成代理模型
计算机视觉与模式识别
2026-03-11 v1
摘要
视觉内容生成从单图像向多图像工作流程发展,然而现有代理模型仍多为计划驱动式,缺乏纠正轨迹中视觉错误的系统性反思机制。为此,我们提出 VisionCreator-R1,一种具显式反思能力的原生视觉生成代理模型,辅以反思-计划联合优化(Reflection-Plan Co-Optimization, RPCO)训练方法。通过大量实验与轨迹层面分析,我们发现强化学习中反思-计划优化存在不对称性:计划可通过计划奖励可靠优化,而反思学习则因信用分配噪声受阻。基于此洞见,RPCO 首先在自构建的 VCR-SFT 数据集上进行训练,包含反思强烈的单图像轨迹与计划强烈的多图像轨迹;随后在 VCR-RL 数据集上进行联合优化,形成我们的统一 VisionCreator-R1 代理模型。该模型在现有基准及覆盖单/多图像任务的 VCR-bench 上均持续超越 Gemini2.5Pro。
引用
@article{arxiv.2603.08812,
title = {VisionCreator-R1: A Reflection-Enhanced Native Visual-Generation Agentic Model},
author = {Jinxiang Lai and Wenzhe Zhao and Zexin Lu and Hualei Zhang and Qinyu Yang and Rongwei Quan and Zhimin Li and Shuai Shao and Song Guo and Qinglin Lu},
journal= {arXiv preprint arXiv:2603.08812},
year = {2026}
}