Nexus:面向语言、音频与视觉的全感知全交互模型
多媒体
2025-10-21 v4 计算机视觉与模式识别
声音
音频与语音处理
摘要
本工作提出一种行业级全模态大型语言模型(LLM)管线,整合听觉、视觉和语言三种模态,以解决如限模态数据稀缺、计算成本高及特征对齐复杂等挑战。我们的管线包含三个主要组成部分:首先,一个模块化框架,支持灵活配置多种编码器-LLM-解码器架构;其次,一种轻量级训练策略,利用最新视觉语言模型 Qwen2.5-VL 进行音频-语言对齐预训练,避免了对视觉特定模态的高成本预训练;第三,一个音频合成管线,从多样化真实场景生成高质量的音频-文本数据,支持自动语音识别和语音到语音聊天等应用。为此,我们引入了行业级全模态 LLM,Nexus。大量实验验证了我们管线的有效性,得出以下关键发现:(1) 在视觉理解任务中,Nexus 的性能优于其基础模型——Qwen2.5-VL-7B,验证了我们训练策略的效率。(2) 在英语口头问答任务中,Nexus 在 LLaMA Q 基准测试中优于同期竞品(即 MiniCPM-o2.6-7B)。(3) 在我们的真实语音测试集中,Nexus 实现卓越的性能,表明其在真实场景中的鲁棒性。(4) 在语音到文本翻译任务中,我们的模型优于 Qwen2-Audio-Instruct-7B。(5) 在文本到语音任务中,基于预训练声码器(如 Fishspeech1.4 或 CosyVoice2.0),Nexus 在 Seed-TTS 基准测试中与其基础声码器持平。(6) 对三模态对齐进行深入分析发现,纳入音频模态可增强视觉与语言之间的表征对齐。
引用
@article{arxiv.2503.01879,
title = {Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision},
author = {Che Liu and Yingji Zhang and Dong Zhang and Weijie Zhang and Chenggong Gong and Yu Lu and Shilin Zhou and Ziliang Gan and Ziao Wang and Haipang Wu and Ji Liu and André Freitas and Qifan Wang and Zenglin Xu and Rongjuncheng Zhang and Yong Dai},
journal= {arXiv preprint arXiv:2503.01879},
year = {2025}
}
备注
Project: https://github.com/HiThink-Research/NEXUS-O