中文

Unify-Agent:面向世界关联图像合成的统一多模态智能体

计算机视觉与模式识别 2026-04-02 v2 多媒体

摘要

统一多模态模型提供了理解复杂真实世界知识并生成高质�图像的自然且前景广阔的架构。然而,它们仍主要依赖冻结的参数化知识,难以应对涉及长尾和知识密集型概念的真实世界图像生成。鼓舞于智能体在真实任务中的广泛成功,我们探索了智能体建模以克服这一限制。具体而言,我们提出了Unify-Agent——一个面向世界关联图像合成的统一多模态智能体,将图像生成重新框定为由提示理解、多模态证据搜索、关联重述和最终合成组成的智能体管道。为训练我们的模型,我们构建了量身定做的多模态数据管道,并精选了14.3万组高质量的智能体轨迹,用于世界关联图像合成,有效监督整个智能体生成过程。我们进一步引入FactIP基准,覆盖12类具有文化意义和长尾事实概念的概念,显式要求外部知识关联。在大量实验中,我们发现,所提出的Unify-Agent在多样化基准和真实世界生成任务中均显著优于其基础统一模型,接近最强闭源模型的世界知识能力。作为对基于智能体的世界关联图像合成的早期探索,我们的工作凸显了将推理、搜索与生成紧密耦合以实现可靠开放世界智能体图像合成的价值。

关键词

引用

@article{arxiv.2603.29620,
  title  = {Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis},
  author = {Shuang Chen and Quanxin Shou and Hangting Chen and Yucheng Zhou and Kaituo Feng and Wenbo Hu and Yi-Fan Zhang and Yunlong Lin and Wenxuan Huang and Mingyang Song and Dasen Dai and Bolin Jiang and Manyuan Zhang and Shi-Xue Zhang and Zhengkai Jiang and Lucas Wang and Zhao Zhong and Yu Cheng and Nanyun Peng},
  journal= {arXiv preprint arXiv:2603.29620},
  year   = {2026}
}

备注

Project Page: https://github.com/shawn0728/Unify-Agent