中文

VARGPT:基于视觉自回归多模态大语言模型的统一理解与生成

计算机视觉与模式识别 2025-01-22 v1

摘要

我们提出了 VARGPT,一种新型多模态大语言模型 (MLLM),在单个自回归框架中统一了视觉理解与生成。VARGPT 采用 next-token 预测范式进行视觉理解,采用 next-scale 预测范式进行视觉自回归生成。VARGPT 创新性地扩展了 LLaVA 架构,在 MLLMs 中实现了高效的 scale 级自回归视觉生成,同时在单个模型框架中无缝支持混合模式的输入与输出。我们的 VARGPT 经过三个阶段的统一训练,基于精心挑选的数据集,包括预训练阶段和两个混合视觉指令微调阶段。统一的训练策略旨在实现视觉与文本特征的对齐,提高两端理解和生成的指令遵循能力,并提升视觉生成质量。尽管其基于 LLAVA 的架构实现多模态理解,VARGPT 在各种以视觉为中心的基准测试中(如视觉问答和推理任务)显著优于 LLaVA-1.5。值得注意的是,VARGPT 自然支持 autoregressive 视觉生成和 instruction-to-image 合成能力,展现了在视觉理解和生成任务中的多样性。项目页面见:\url{https://vargpt-1.github.io/}

关键词

引用

@article{arxiv.2501.12327,
  title  = {VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model},
  author = {Xianwei Zhuang and Yuxin Xie and Yufan Deng and Liming Liang and Jinghan Ru and Yuguo Yin and Yuexian Zou},
  journal= {arXiv preprint arXiv:2501.12327},
  year   = {2025}
}