X-LLM:将多模态视为外语以引导高级大语言模型
计算与语言
2023-05-23 v3 人工智能
计算机视觉与模式识别
音频与语音处理
摘要
大语言模型(LLMs)已展现出卓越的语言能力。基于高级 LLM 的 GPT-4 表现出超越以往视觉语言模型的 extraordinary 多模态能力。我们将此归因于与以往多模态模型相比使用了更先进的 LLM。遗憾的是,GPT-4 的模型架构与训练策略尚不为人知。为赋予 LLM 多模态能力,我们提出 X-LLM,其使用 X2L 接口将多模态(图像、语音、视频)转换为外语并输入大语言模型(ChatGLM)。具体而言,X-LLM 使用 X2L 接口将多个冻结的单模态编码器与一个冻结的 LLM 对齐,其中“X”表示图像、语音、视频等多模态,“L”表示语言。X-LLM 的训练包含三个阶段:(1)转换多模态信息:第一阶段分别训练每个 X2L 接口以与其各自的单模态编码器对齐,将多模态信息转换为语言。(2)将 X2L 表示与 LLM 对齐:通过 X2L 接口将单模态编码器与 LLM 独立对齐。(3)整合多模态:通过 X2L 接口将所有单模态编码器与 LLM 对齐,将多模态能力整合进 LLM。我们的实验表明,X-LLM 展现出令人印象深刻的的多模型对话能力,有时在未见过的图像/指令上表现出多模态 GPT-4 的行为,并在合成多模态指令跟随数据集上相较 GPT-4 取得 84.5% 的相对分数。我们还对使用 LLM 进行 ASR 与多模态 ASR 进行了定量测试,希望推动基于 LLM 的语音识别时代。
引用
@article{arxiv.2305.04160,
title = {X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages},
author = {Feilong Chen and Minglun Han and Haozhi Zhao and Qingyang Zhang and Jing Shi and Shuang Xu and Bo Xu},
journal= {arXiv preprint arXiv:2305.04160},
year = {2023}
}