中文

基于零样本模型选择的语音增强

音频与语音处理 2021-09-01 v2 机器学习 声音

摘要

近年来,语音增强(SE)研究出现了基于深度学习的方法。如何在多样测试条件下有效提升 SE 的泛化能力仍是一项具有挑战性的任务。本研究结合零样本学习与集成学习,提出一种零样本模型选择(ZMOS)方法以提升 SE 性能的泛化能力。所提方法在离线与在线两个阶段实现。离线阶段将全部训练数据聚类为多个子集,并基于每个子集训练一个专用的 SE 模型(称为分量 SE 模型)。在线阶段选择最合适的分量 SE 模型执行增强。此外,开发了两种选择策略:基于质量分数(QS)的选择与基于质量嵌入(QE)的选择。QS 与 QE 均通过非侵入式质量评估网络 Quality-Net 获得。实验结果证实,相较于基线系统与其他模型选择系统,所提 ZMOS 方法在已知与未知噪声类型下均能取得更优性能,表明该方法在提供鲁棒 SE 性能方面的有效性。

关键词

引用

@article{arxiv.2012.09359,
  title  = {Speech Enhancement with Zero-Shot Model Selection},
  author = {Ryandhimas E. Zezario and Chiou-Shann Fuh and Hsin-Min Wang and Yu Tsao},
  journal= {arXiv preprint arXiv:2012.09359},
  year   = {2021}
}

备注

Accepted in EUSIPCO 2021