中文

基于混合专家的语音质量评估模型:系统层面的性能提升与说话单元层面的挑战分析

声音 2025-07-09 v1 人工智能 音频与语音处理

摘要

自动语音质量评估在语音合成系统的开发中发挥着关键作用,但现有模型在不同预测任务的不同粒度层面上表现出显著的性能差异。本文提出一种增强的 MOS 预测系统,基于自监督学习语音模型,融合混合专家 (MoE) 分类头,并利用来自多个商业生成模型的合成数据进行数据增强。我们的方法基于已有的自监督模型如 wav2vec2,设计专门的 MoE 架构以解决不同类型的语音质量评估任务。我们还收集了一个大规模合成语音数据集,涵盖最新的文本转语音、语音转换和语音增强系统。然而,尽管采用了 MoE 架构和扩大数据集,模型在句子级预测任务中的性能提升仍有限。我们的工作揭示了当前方法在处理句子级质量评估方面的局限性,为语音质量评估领域提供了新的技术路径,并深入探讨了不同评估粒度之间性能差异的根本原因。

关键词

引用

@article{arxiv.2507.06116,
  title  = {Speech Quality Assessment Model Based on Mixture of Experts: System-Level Performance Enhancement and Utterance-Level Challenge Analysis},
  author = {Xintong Hu and Yixuan Chen and Rui Yang and Wenxiang Guo and Changhao Pan},
  journal= {arXiv preprint arXiv:2507.06116},
  year   = {2025}
}