带与不带并行语音数据的语音增强音素反馈
音频与语音处理
2020-03-05 v1 计算与语言
声音
摘要
尽管深度学习系统在语音增强研究中已取得重大进展,这些系统尚未充分利用深度学习系统的全部潜力来提供高层反馈。特别是,音素反馈在语音增强研究中很少见,尽管其包含有价值的自顶向下信息。我们使用模仿损失(mimic loss)技术为现成的增强系统提供音素反馈,并在 CHiME-4 数据上发现客观可懂度分数的提升。该技术在无并行语音数据可用的情况下,利用在干净语音上训练的冻结声学模型为增强模型提供有价值的反馈。我们的工作是首批展示在无并行语音数据下神经增强系统可懂度提升的研究之一,并且我们展示了音素反馈能够改进使用并行语音数据训练的最先进神经增强系统。
引用
@article{arxiv.2003.01769,
title = {Phonetic Feedback for Speech Enhancement With and Without Parallel Speech Data},
author = {Peter Plantinga and Deblin Bagchi and Eric Fosler-Lussier},
journal= {arXiv preprint arXiv:2003.01769},
year = {2020}
}
备注
4 pages + 1 page for references, accepted to ICASSP 2020