中文

AMRConvNet: 基于卷积神经网络的AMR编码语音增强

音频与语音处理 2020-08-25 v1 声音

摘要

语音通过语音编码转换为数字信号以实现高效传输。然而,这通常会降低语音的质量与带宽。本文探索了卷积神经网络在编码语音上的人工带宽扩展(ABE)与语音增强中的应用,特别是用于2G蜂窝电话通话的自适应多速率(AMR)编码。本文中,我们介绍了AMRConvNet:一种对AMR编码语音执行ABE与语音增强的卷积神经网络。该模型在时域上直接处理输入与输出语音,但采用时域重构损失与频域感知损失的组合进行优化。AMRConvNet在AMR码率4.75k下平均提升了0.425个平均意见得分-听感质量客观(MOS-LQO)点,在AMR码率12.2k下提升了0.073个MOS-LQO点。AMRConvNet在AMR码率输入下也表现出鲁棒性。最后,消融实验表明,相比单独使用任一种损失,我们的时域与频域组合损失带来了略高的MOS-LQO以及更快的训练收敛。

关键词

引用

@article{arxiv.2008.10233,
  title  = {AMRConvNet: AMR-Coded Speech Enhancement Using Convolutional Neural Networks},
  author = {Williard Joshua Jose},
  journal= {arXiv preprint arXiv:2008.10233},
  year   = {2020}
}

备注

IEEE SMC 2020