语音增强中跨域损失的研究
声音
2021-06-01 v2 机器学习
音频与语音处理
摘要
近年来,可用的语音增强(SE)与识别框架数量激增。无论基于模型还是通过深度学习构建,这些框架通常孤立地依赖时域信号或语音数据的时频(TF)表示。本研究中,我们通过分别考察时域与 TF 方法对语音可懂度与质量的影响,探究各类方法的优势。此外,我们引入两种新的跨域 SE 框架,以结合时域与 TF 语音表示的分散优势。我们与近期基于模型及深度学习的 SE 方法进行了定量对比分析,以阐明所提框架的价值。
引用
@article{arxiv.2010.10468,
title = {Investigating Cross-Domain Losses for Speech Enhancement},
author = {Sherif Abdulatif and Karim Armanious and Jayasankar T. Sajeev and Karim Guirguis and Bin Yang},
journal= {arXiv preprint arXiv:2010.10468},
year = {2021}
}
备注
5 pages, 3 figures and 1 table