NExT-GPT:任意模态到任意模态的多模态大语言模型
人工智能
2024-06-26 v3 计算与语言
机器学习
摘要
尽管近来多模态大语言模型(MM-LLMs)取得了令人振奋的进展,但它们大多受限于仅能进行输入侧的多模态理解,而不具备以多种模态生成内容的能力。由于我们人类总是通过各种模态感知世界并与人交流,开发能够接受并以任意模态输出内容的任意到任意 MM-LLM 对于实现类人水平的 AI 至关重要。为弥补这一空白,我们提出了一个端到端的通用任意到任意 MM-LLM 系统 NExT-GPT。我们将一个 LLM 与多模态适配器以及不同的扩散解码器相连,使 NExT-GPT 能够以文本、图像、视频和音频的任意组合感知输入并生成输出。通过利用现有训练良好且性能优异的编码器和解码器,NExT-GPT 仅对某些投影层的一小部分参数(1%)进行微调,这不仅有利于低成本训练,也便于便捷地扩展到更多潜在模态。此外,我们引入了模态切换指令微调(MosIT)并人工整理了一份用于 MosIT 的高质量数据集,基于此 NExT-GPT 获得了复杂的跨模态语义理解与内容生成能力。总体而言,我们的研究展示了构建能够建模通用模态的 AI 智能体的可行前景,为该领域更类人的 AI 研究铺平了道路。项目主页:https://next-gpt.github.io/
引用
@article{arxiv.2309.05519,
title = {NExT-GPT: Any-to-Any Multimodal LLM},
author = {Shengqiong Wu and Hao Fei and Leigang Qu and Wei Ji and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2309.05519},
year = {2024}
}
备注
ICML 2024 (Oral)