SAISA:兼顾训练与推理效率的多模态大语言模型
计算与语言
2025-02-05 v1 计算机视觉与模式识别
摘要
多模态大语言模型 (MLLM) 主要分为两种架构,每种架构都涉及训练与推理效率之间的权衡:嵌入空间对齐(例如 LLaVA-1.5)在推理时效率低下,而交叉注意力空间对齐(例如 Flamingo)则在训练时效率低下。在本文中,我们比较了这两种架构,并确定了构建高效 MLLM 的关键因素。它们之间的一个主要区别在于注意力如何应用于视觉 token,特别是它们之间的交互。为了探究视觉 token 之间的注意力是否必要,我们提出了一种新的自注意力机制 NAAViT(视觉 token 间无注意力),它消除了这类注意力。我们在 LLaVA-1.5 上的初步实验表明,视觉 token 之间的注意力是高度冗余的。基于这些见解,我们引入了 SAISA(自注意力输入空间对齐),这是一种能同时提升训练和推理效率的新型架构。SAISA 直接将视觉特征与 NAAViT 自注意力块的输入空间对齐,减少了自注意力块和前馈网络 (FFN) 中的计算开销。使用与 LLaVA-1.5 相同的配置,SAISA 将推理 FLOPs 降低了 66%,训练预算降低了 26%,同时在准确率方面取得了更优的性能。全面的消融研究进一步验证了 SAISA 在各种 LLM 和视觉编码器上的有效性。代码和模型将在 https://github.com/icip-cas/SAISA 公开发布。
引用
@article{arxiv.2502.02458,
title = {SAISA: Towards Multimodal Large Language Models with Both Training and Inference Efficiency},
author = {Qianhao Yuan and Yanjiang Liu and Yaojie Lu and Hongyu Lin and Ben He and Xianpei Han and Le Sun},
journal= {arXiv preprint arXiv:2502.02458},
year = {2025}
}