中文

基于自监督表示损失的与下游任务无关的语音增强

音频与语音处理 2023-05-25 v1 声音

摘要

自监督学习(SSL)是语音处理领域的最新突破,尤其通过利用海量无标注音频数据,惠及标注稀缺的下游任务。SSL的噪声鲁棒性是拓展其应用的重要挑战之一。我们可以使用语音增强(SE)来解决此问题。然而,SE模型与SSL模型之间的不匹配可能限制其效果。在本工作中,我们提出一种新的SE训练准则,最小化SSL模型特征表示中干净信号与增强信号之间的距离,以缓解该不匹配。我们期望SSL域中的损失能够引导SE训练,保留或增强高层下游任务可能所需的语音信号各层次特征。实验表明,我们的方案在带噪输入下提升了SE与SSL流水线的五项下游任务性能,同时保持了SE性能。

关键词

引用

@article{arxiv.2305.14723,
  title  = {Downstream Task Agnostic Speech Enhancement with Self-Supervised Representation Loss},
  author = {Hiroshi Sato and Ryo Masumura and Tsubasa Ochiai and Marc Delcroix and Takafumi Moriya and Takanori Ashihara and Kentaro Shinayama and Saki Mizuno and Mana Ihori and Tomohiro Tanaka and Nobukatsu Hojo},
  journal= {arXiv preprint arXiv:2305.14723},
  year   = {2023}
}

备注

4 pages , 2 figures, Accepted to Interspeech 2023