中文

Pisces: 一种用于图像理解与生成的自回归基础模型

计算机视觉与模式识别 2025-07-15 v2 人工智能

摘要

大型语言模型(LLM)的最新进展使多模态基础模型能够在统一框架内同时处理图像理解与生成。尽管取得了这些进展,统一模型在任一任务上的表现往往不如专用模型。开发统一模型的一个关键挑战在于图像理解与生成所需视觉特征之间的固有差异,以及每种模态所需的不同训练过程。在本工作中,我们提出了 Pisces,一种自回归多模态基础模型,通过一种新颖的解耦视觉编码架构和针对多模态生成优化的定制训练技术来解决这一挑战。结合细致的数据整理、预训练和微调,Pisces 在图像理解和图像生成两方面均取得了具有竞争力的性能。我们在超过 20 个公开图像理解基准上评估了 Pisces,其在广泛的任务中展现了强劲的性能。此外,在广泛采用的图像生成基准 GenEval 上,Pisces 展现了稳健的生成能力。我们的广泛分析揭示了图像理解与生成之间的协同关系,以及使用独立视觉编码器的益处,推动了统一多模态模型领域的发展。

关键词

引用

@article{arxiv.2506.10395,
  title  = {Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation},
  author = {Zhiyang Xu and Jiuhai Chen and Zhaojiang Lin and Xichen Pan and Lifu Huang and Tianyi Zhou and Madian Khabsa and Qifan Wang and Di Jin and Michihiro Yasunaga and Lili Yu and Xi Victoria Lin and Shaoliang Nie},
  journal= {arXiv preprint arXiv:2506.10395},
  year   = {2025}
}

备注

Unified image understanding and generation model