增强至编解码器:基于向量量化自编码器的噪声鲁棒语音编码
音频与语音处理
2021-02-15 v1 机器学习
摘要
基于离散化神经自编码器的音频编解码器近期已被开发,并显示出在可比质量语音输出下显著更高的压缩水平。然而,这些模型与语音内容紧密耦合,在噪声条件下会产生非预期输出。基于带 WaveRNN 解码器的 VQ-VAE 自编码器,我们开发了压缩-增强编码器及相应解码器,并表明它们在噪声条件下运行良好。我们还观察到,压缩-增强模型在干净语音输入上的表现优于仅在干净语音上训练的压缩模型。
引用
@article{arxiv.2102.06610,
title = {Enhancing into the codec: Noise Robust Speech Coding with Vector-Quantized Autoencoders},
author = {Jonah Casebeer and Vinjai Vale and Umut Isik and Jean-Marc Valin and Ritwik Giri and Arvindh Krishnaswamy},
journal= {arXiv preprint arXiv:2102.06610},
year = {2021}
}
备注
5 pages, 2 figures, ICASSP 2021