中文

Chameleon:混合模态早融合基础模型

计算与语言 2025-03-24 v2

摘要

我们提出了 Chameleon,这是一族基于早融合、基于 token 的混合模态模型,能够以任意序列理解和生成图像与文本。我们概述了从初始阶段开始的稳定训练方法、对齐方案以及专为早融合、基于 token 的混合模态设定量身定制的架构参数化。这些模型在全面的任务范围内进行了评估,包括视觉问答、图像描述、文本生成、图像生成以及长篇混合模态生成。Chameleon 展现了广泛且通用的能力,包括在图像描述任务中的 SOTA 性能,在纯文本任务中优于 Llama-2,同时与 Mixtral 8x7B 和 Gemini-Pro 等模型具有竞争力,并且能够在单一模型中执行非平凡的图像生成。在一项新的长篇混合模态生成评估中(其中提示或输出包含图像和文本的混合序列),根据人类判断,它还匹配或超越了包括 Gemini Pro 和 GPT-4V 在内的更大模型的性能。Chameleon 标志着在统一建模完整多模态文档方面迈出了重要一步。

关键词

引用

@article{arxiv.2405.09818,
  title  = {Chameleon: Mixed-Modal Early-Fusion Foundation Models},
  author = {Chameleon Team},
  journal= {arXiv preprint arXiv:2405.09818},
  year   = {2025}
}