模态即插即用:面向具身 AI 的多模态大语言模型弹性模态自适应
人工智能
2023-12-14 v1 计算与语言
摘要
大语言模型(LLMs)能够通过预训练的编码器对多种输入数据模态进行推理。然而,输入数据模态的日益多样化阻碍了将所有模态纳入 LLMs,尤其是当 LLMs 部署在资源受限的边缘设备上用于具身 AI 应用时。相反,一个更好的选择是根据当前的环境上下文和任务需求,在运行时自适应地仅涉及有用的模态。对于这种模态自适应,现有工作采用编码器与 LLM 输入层之间的固定连接,导致运行时训练成本高且跨模态交互效果不佳。在本文中,我们通过提出 mPnP-LLM 来解决这些局限性,这是一种允许完全弹性、自动化且即时的运行时模态自适应的新技术,通过将单模态编码器连接到一组灵活的末端 LLM 块,并使这种潜在连接在运行时完全可训练。在 nuScenes-QA 数据集上的实验表明,mPnP-LLM 可以实现高达 3.7 倍的 FLOPs 减少和 30% 的 GPU 内存使用减少,同时保持与现有方案相当的准确率。在相同的计算预算下,与最佳现有方案相比,mPnP-LLM 将任务准确率提高了高达 4%。
引用
@article{arxiv.2312.07886,
title = {Modality Plug-and-Play: Elastic Modality Adaptation in Multimodal LLMs for Embodied AI},
author = {Kai Huang and Boyuan Yang and Wei Gao},
journal= {arXiv preprint arXiv:2312.07886},
year = {2023}
}