中文

隐式多模态对齐:冻结大语言模型泛化到多模态输入的研究

计算机视觉与模式识别 2024-10-08 v2 计算与语言 机器学习

摘要

大语言模型(LLMs)在多模态任务上展现了令人印象深刻的性能,且无需任何多模态微调。它们是大型多模态模型的基石,然而,我们对其成功的原因仍缺乏恰当的理解。在本工作中,我们将冻结的LLMs暴露于图像、视频、音频和文本输入,并分析其内部表示,旨在理解其超越文本输入的泛化能力。研究发现:(1)感知标记在LLMs内部易于与文本标记区分,具有显著不同的表示,且不存在到文本标记的完全转换。然而,(2)感知标记和文本标记激活了相似的LLM权重。尽管存在差异,(3)感知标记和文本标记在LLMs内部是隐式对齐的,我们称之为隐式多模态对齐(IMA),并认为这与架构设计有关,有助于LLMs的泛化。这为相信LLMs对多模态输入的泛化主要归因于其架构提供了更多证据。启示:(1)我们发现隐式对齐分数与任务性能之间存在正相关,表明这可以作为模型评估和选择的代理指标。(2)与幻觉存在负相关,揭示该问题主要源于内部感知表示与文本表示之间的未对齐。(3)感知标记在整个模型中变化轻微,因此,我们提出了不同的方法来跳过计算(例如在前馈网络层中),从而显著降低推理成本。(4)由于嵌入在层间变化缓慢,且文本与多模态激活权重高度重叠,我们通过仅保留一个在广泛多模态任务上表现良好的子网络来压缩LLMs。论文代码:https://github.com/mshukor/ima-lmms。

关键词

引用

@article{arxiv.2405.16700,
  title  = {Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs},
  author = {Mustafa Shukor and Matthieu Cord},
  journal= {arXiv preprint arXiv:2405.16700},
  year   = {2024}
}

备注

NeurIPS 2024. Code: https://github.com/mshukor/ima-lmms. Project page: https://ima-lmms.github.io/