UniMoE-Audio:基于动态容量MoE的统一语音与音乐生成
声音
2025-10-16 v1 计算与语言
摘要
近期统一多模态模型的进展表明了向全面内容生成发展的明确趋势。然而,听觉领域仍然是一个重大挑战,音乐和语音往往独立开发,阻碍了通用音频合成的进展。这种分离源于固有的任务冲突和严重的数据不平衡,阻碍了真正统一音频生成模型的发展。为了应对这一挑战,我们提出了UniMoE-Audio,一个在新型动态容量混合专家(MoE)框架内的统一语音和音乐生成模型。在架构上,UniMoE-Audio引入了Top-P路由策略以实现动态专家数量分配,以及一种混合专家设计,包括用于领域特定知识的可路由专家、用于领域无关特征的共享专家以及用于自适应计算跳过的空专家。为了解决数据不平衡,我们引入了一个三阶段训练课程:1)独立专家训练利用原始数据集将领域特定知识注入每个'原型专家'而不受干扰;2)MoE集成与预热将这些专家纳入UniMoE-Audio架构,使用平衡数据集的子集对门模块和共享专家进行预热;3)协同联合训练在完全平衡的数据集上端到端训练整个模型,促进增强的跨领域协同。大量实验表明,UniMoE-Audio不仅在主要语音和音乐生成基准测试上达到了最先进的性能,还展示了优越的协同学习能力,缓解了朴素联合训练中常见的性能下降。我们的发现强调了专门化MoE架构和精心设计的训练策略在推进通用音频生成领域的巨大潜力。
引用
@article{arxiv.2510.13344,
title = {UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity MoE},
author = {Zhenyu Liu and Yunxin Li and Xuanyu Zhang and Qixun Teng and Shenyuan Jiang and Xinyu Chen and Haoyuan Shi and Jinchao Li and Qi Wang and Haolan Chen and Fanbo Meng and Mingjun Zhao and Yu Xu and Yancheng He and Baotian Hu and Min Zhang},
journal= {arXiv preprint arXiv:2510.13344},
year = {2025}
}