中文

语音增强中跨域损失的研究

声音 2021-06-01 v2 机器学习 音频与语音处理

摘要

近年来,可用的语音增强(SE)与识别框架数量激增。无论基于模型还是通过深度学习构建,这些框架通常孤立地依赖时域信号或语音数据的时频(TF)表示。本研究中,我们通过分别考察时域与 TF 方法对语音可懂度与质量的影响,探究各类方法的优势。此外,我们引入两种新的跨域 SE 框架,以结合时域与 TF 语音表示的分散优势。我们与近期基于模型及深度学习的 SE 方法进行了定量对比分析,以阐明所提框架的价值。

关键词

引用

@article{arxiv.2010.10468,
  title  = {Investigating Cross-Domain Losses for Speech Enhancement},
  author = {Sherif Abdulatif and Karim Armanious and Jayasankar T. Sajeev and Karim Guirguis and Bin Yang},
  journal= {arXiv preprint arXiv:2010.10468},
  year   = {2021}
}

备注

5 pages, 3 figures and 1 table