Spider:任意到多模态大语言模型
计算机视觉与模式识别
2025-04-08 v2
摘要
多模态大语言模型 (MLLM) 作为大语言模型 (LLM) 的延伸应运而生,实现了多种模态的融合。然而,任意到任意 MLLM 仅能在单次响应中生成成对模态“文本 + X”,如文本 + {图像或音频或视频}。为解决这一局限,我们提出 Spider,一种新颖高效的任意到多模态生成 (AMMG) 框架,可生成任意模态组合“文本 + Xs”,如文本 + {图像和音频和视频}。为实现高效 AMMG,Spider 集成了三大核心组件:用于基础 X 到 X(即任意到任意)模态处理的基座模型、面向生成 Xs 信号提示的任意到多指令模板,以及用于控制多模态解码器生成 Xs(多模态)内容的新型高效解码器控制器。为训练 Spider,我们构建了新型文本格式多模态 (TMM) 数据集,便于学习实现 AMMG 所需的 X 到 Xs(即任意到多)能力。最终,训练良好的 Spider 生成伪 X 到 Xs 数据集,即首个 X 到 Xs 多模态数据集,增强了未来研究中 AMMG 任务的潜力。总体而言,这项工作不仅推动了多模态交互的边界,也为推动该领域发展提供了丰富的数据支持。代码:https://github.com/Layjins/Spider
引用
@article{arxiv.2411.09439,
title = {Spider: Any-to-Many Multimodal LLM},
author = {Jinxiang Lai and Jie Zhang and Jun Liu and Jian Li and Xiaocheng Lu and Song Guo},
journal= {arXiv preprint arXiv:2411.09439},
year = {2025}
}