AnyGPT:具有离散序列建模的统一多模态大语言模型
计算与语言
2025-09-09 v5 人工智能
计算机视觉与模式识别
机器学习
摘要
我们推出了 AnyGPT,这是一种任意到任意的多模态语言模型,利用离散表示来统一处理包括语音、文本、图像和音乐在内的各种模态。AnyGPT 可以在不改变当前大语言模型(LLM)架构或训练范式的情况下稳定训练。相反,它完全依赖于数据级预处理,从而促进新模态无缝集成到 LLM 中,类似于新语言的融入。我们构建了一个以文本为中心的多模态数据集,用于多模态对齐预训练。利用生成模型,我们合成了首个大规模任意到任意多模态指令数据集。该数据集包含 10.8 万个多轮对话样本,错综复杂地交织了各种模态,从而使模型能够处理任意组合的多模态输入和输出。实验结果表明,AnyGPT 能够促进任意到任意的多模态对话,同时在所有模态上达到与专用模型相当的性能,证明了离散表示可以有效地且方便地在语言模型内统一多种模态。演示见 https://junzhan2000.github.io/AnyGPT.github.io/
引用
@article{arxiv.2402.12226,
title = {AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling},
author = {Jun Zhan and Junqi Dai and Jiasheng Ye and Yunhua Zhou and Dong Zhang and Zhigeng Liu and Xin Zhang and Ruibin Yuan and Ge Zhang and Linyang Li and Hang Yan and Jie Fu and Tao Gui and Tianxiang Sun and Yu-Gang Jiang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2402.12226},
year = {2025}
}
备注
28 pages, 16 figures, under review, work in progress