中文

STAR:堆叠自回归方案用于统一多模态学习

计算机视觉与模式识别 2025-12-17 v1 人工智能

摘要

多模态大语言模型(Multimodal Large Language Models, MLLMs)在推动通用人工智能的实现方面发挥着关键作用。然而,由于优化冲突和性能权衡,实现多模态理解和生成的统一目标仍然具有挑战性。为了在保持现有理解能力的同时提高生成性能,我们提出STAR:一种用于任务渐进式统一多模态学习的堆叠自回归方案(STacked AutoRegressive scheme for task-progressive unified multimodal learning)。该方法将多模态学习分解为多个阶段:理解、生成和编辑。通过冻结基本自回归(AR)模型的参数并逐层堆叠同构AR模块,可以避免跨任务干扰并扩充模型的能力。同时,我们引入了高容量矢量量化(VQ)来增强图像表征的细粒度,并采用隐式推理机制以提高复杂条件下的生成质量。实验表明,STAR在GenEval(0.91)、DPG-Bench(87.44)和ImgEdit(4.34)上实现了最先进的性能,验证了其在统一多模态学习方面的有效性。

关键词

引用

@article{arxiv.2512.13752,
  title  = {STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning},
  author = {Jie Qin and Jiancheng Huang and Limeng Qiao and Lin Ma},
  journal= {arXiv preprint arXiv:2512.13752},
  year   = {2025}
}

备注

18 pages, 7 figures