中文

ARMOR:赋予多模态理解模型交错多模态生成能力

计算机视觉与模式识别 2025-06-09 v2 人工智能

摘要

统一的多模态理解与生成近期在视觉与语言领域受到了广泛关注。现有的统一模型(UniMs)旨在同时学习多模态理解与生成能力,这需要大量的计算资源,且通常难以生成交错的文本与图像。我们提出了 ARMOR,这是一个资源高效且纯自回归的框架,通过微调现有的多模态大语言模型(MLLMs)来实现理解与生成。具体而言,ARMOR 从三个维度扩展现有的 MLLMs:(1)在模型架构方面,引入了带有前向切换机制的非对称编码器-解码器架构,以统一整合文本与视觉模态的嵌入空间,从而以最小的计算开销实现自然的文本-图像交错生成。(2)在训练数据方面,精心策划并收集了高质量的交错数据集用于微调 MLLMs。(3)在训练算法方面,我们提出了一种“生成什么或如何生成”的算法,基于收集的数据集通过三个渐进的训练阶段,在保留现有 MLLMs 多模态理解能力的同时,赋予其多模态生成能力。实验结果表明,ARMOR 能够利用有限的训练资源,将现有的 MLLMs 升级为具有良好图像生成能力的 UniMs。我们的代码即将发布于 https://github.com/finyorko/armor。

关键词

引用

@article{arxiv.2503.06542,
  title  = {ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability},
  author = {Jianwen Sun and Yukang Feng and Chuanhao Li and Fanrui Zhang and Zizhen Li and Jiaxin Ai and Sizhuo Zhou and Yu Dai and Shenglin Zhang and Kaipeng Zhang},
  journal= {arXiv preprint arXiv:2503.06542},
  year   = {2025}
}