一种用于基于神经网络的实时语音增强的调制域损失
音频与语音处理
2021-02-16 v1
摘要
我们描述了一种用于基于深度学习的语音增强系统的调制域损失函数。可学习的谱时感受野(STRFs)被调整以优化说话人识别任务。随后将学习到的STRFs用于计算调制域中的加权均方误差(MSE),以训练语音增强系统。实验表明,在谱时域MSE之外加入调制域MSE,显著改善了实时语音增强系统语音质量与可懂度的客观预测,且在推理时不会带来额外计算开销。
引用
@article{arxiv.2102.07330,
title = {A Modulation-Domain Loss for Neural-Network-based Real-time Speech Enhancement},
author = {Tyler Vuong and Yangyang Xia and Richard M. Stern},
journal= {arXiv preprint arXiv:2102.07330},
year = {2021}
}
备注
Accepted IEEE ICASSP 2021