中文

VisionCreator:具备理解、思考、规划与创造力的原生视觉生成智能体模型

计算机视觉与模式识别 2026-03-04 v1

摘要

视觉内容创建任务需要细致的设计规范和创意工作流程理解——这对通用模型而言具有挑战性;而基于工作流程的智能体又缺乏针对自主创意规划的专业知识。为此,我们提出VisionCreator,一个统一了理解、思考、规划与创造(UTPC)能力的原生视觉生成智能体模型,构建于端到端可学习的框架中。我们的工作包含四个关键贡献:(i) 提出 VisGenData-4k 及其构建方法论,利用基于元认知的 VisionAgent 生成具有明确 UTPC 结构的高质量创建轨迹;(ii) VisionCreator 智能体模型,通过渐进专业化训练(PST)和虚拟强化学习(VRL)于高保真模拟环境中,实现对复杂创建任务中 UTPC 能力的稳定高效获取;(iii) VisGenBench,一个涵盖 1.2k 个测试样本的综合性基准,涵盖多种场景,用于标准化评估多步骤视觉创建能力;(iv) 值得注意的是,我们的VisionCreator-8B/32B模型在多个评估维度上均优于较大的闭源模型。总体而言,本工作为视觉生成智能体系统的未来研究提供了基础。

关键词

引用

@article{arxiv.2603.02681,
  title  = {VisionCreator: A Native Visual-Generation Agentic Model with Understanding, Thinking, Planning and Creation},
  author = {Jinxiang Lai and Zexin Lu and Jiajun He and Rongwei Quan and Wenzhe Zhao and Qinyu Yang and Qi Chen and Qin Lin and Chuyue Li and Tao Gao and Yuhao Shan and Shuai Shao and Song Guo and Qinglin Lu},
  journal= {arXiv preprint arXiv:2603.02681},
  year   = {2026}
}