ANOLE:面向交错图像-文本生成的开源、自回归、原生大型多模态模型
计算与语言
2024-07-09 v1 人工智能
计算机视觉与模式识别
摘要
以往的开源大型多模态模型(LMM)面临多个局限性:(1)它们常缺乏原生集成,需借助适配器将视觉表征与预训练大型语言模型(LLM)对齐;(2)许多模型受限于单模态生成;(3)虽然部分模型支持多模态生成,但依赖独立的扩散模型进行视觉建模与生成。为缓解这些局限,本文提出Anole——一种面向交错图像-文本生成的开源、自回归、原生大型多模态模型。我们基于 Meta AI 的 Chameleon 构建 Anole,采用既数据高效又参数高效的微调策略。Anole 展示出高质量、连贯的多模态生成能力。我们已开源模型、训练框架及指令微调数据。
引用
@article{arxiv.2407.06135,
title = {ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation},
author = {Ethan Chern and Jiadi Su and Yan Ma and Pengfei Liu},
journal= {arXiv preprint arXiv:2407.06135},
year = {2024}
}