MoST:基于模态感知的混合专家模型融合语音与文本
计算与语言
2026-01-16 v1 人工智能
机器学习
声音
摘要
我们提出了MoST(语音与文本的混合),一种新颖的多模态大语言模型,通过我们提出的模态感知混合专家(MAMoE)架构无缝集成了语音和文本处理。虽然当前的多模态模型通常使用相同的参数处理不同的模态表示,忽略了它们固有的表示差异,但我们引入了专门的路由路径,根据输入类型将令牌引导至适合模态的专家。MAMoE通过两个互补组件同时增强了模态特定学习和跨模态理解:捕获领域特定模式的模态特定专家组,以及促进模态间信息传输的共享专家。基于此架构,我们开发了一个高效的转换流水线,通过在ASR和TTS数据集上进行策略性后训练,然后使用精心策划的语音-文本指令数据集进行微调,来适配预训练的MoE语言模型。该流水线的一个关键特征是它完全依赖于可完全访问的开源数据集,以实现强大的性能和高效的数据利用。在ASR、TTS、音频语言建模和口语问答基准上的全面评估表明,MoST在参数数量相当的情况下始终优于现有模型。我们的消融研究证实,模态特定路由机制和共享专家设计对所有测试领域的性能提升都有显著贡献。据我们所知,MoST代表了第一个完全开源的、基于混合专家架构的语音-文本LLM。\footnote{我们在https://github.com/NUS-HPC-AI-Lab/MoST发布MoST模型、训练代码、推理代码和训练数据。
引用
@article{arxiv.2601.10272,
title = {MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts},
author = {Yuxuan Lou and Kai Yang and Yang You},
journal= {arXiv preprint arXiv:2601.10272},
year = {2026}
}