中文

MGM-Omni:将全能 LLM 扩展至个性化长时程语音

声音 2025-09-30 v1 人工智能 计算与语言 计算机视觉与模式识别 多媒体

摘要

我们提出了 MGM-Omni,一种用于全模态理解与富有表现力的长时程语音生成的统一全能 LLM。与隔离语音合成的级联流水线不同,MGM-Omni 采用了“脑-口”设计,具有双轨、基于 token 的架构,将多模态推理与实时语音生成干净地解耦。这种设计实现了高效的跨模态交互以及低延迟的流式语音生成。在理解方面,统一的训练策略结合双音频编码器设计,实现了在各种声学条件下的长音频感知。在生成方面,基于分块的并行解码方案缩小了文本与语音的 token 速率差距,加速了推理并支持在长时间跨度内保持稳定音色的流式零样本语音克隆。与同期工作相比,MGM-Omni 以显著具有数据效率的训练实现了这些能力。大量实验表明,MGM-Omni 在跨长序列保持音色身份、生成自然且具有上下文感知的语音以及实现卓越的长音频与全模态理解方面,均优于现有的开源模型。MGM-Omni 为全模态理解与可控、个性化的长时程语音生成建立了一种高效的端到端范式。

关键词

引用

@article{arxiv.2509.25131,
  title  = {MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech},
  author = {Chengyao Wang and Zhisheng Zhong and Bohao Peng and Senqiao Yang and Yuqi Liu and Haokun Gui and Bin Xia and Jingyao Li and Bei Yu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2509.25131},
  year   = {2025}
}

备注

Code is available at https://github.com/dvlab-research/MGM-Omni