利用神经语音合成改善 Opus 低码率质量
音频与语音处理
2020-08-11 v3 声音
摘要
Opus 音频编码器的语音模式能以 6 kb/s 到 40 kb/s 的码率压缩宽带语音。然而,Opus 其核心是一种波形匹配编码器,当码率降至 10 kb/s 以下时,质量迅速下降。当码率进一步降低时,参数化编码器往往比波形编码器表现更好。在本文中,我们提出一种向后兼容的方法,通过从解码参数重新合成语音来改善低码率 Opus 质量。我们比较了两种不同的神经生成模型:WaveNet 和 LPCNet。WaveNet 是一种强大、高复杂度、高延迟的架构,对于实际系统不可行,但提供了生成模型已知可达到的最佳质量。LPCNet 是一种低复杂度、低延迟的基于 RNN 的生成模型,可在手机上实际实现。我们将这些系统以 Opus 在 6 kb/s 编码的参数作为生成模型的条件特征。听力测试表明,对于相同的 6 kb/s Opus 码流,使用 LPCNet 合成的语音明显优于标准 Opus 解码器的输出。这为在不破坏兼容性的前提下改善现有语音和音频波形编码器的解码质量开辟了途径。
引用
@article{arxiv.1905.04628,
title = {Improving Opus Low Bit Rate Quality with Neural Speech Synthesis},
author = {Jan Skoglund and Jean-Marc Valin},
journal= {arXiv preprint arXiv:1905.04628},
year = {2020}
}
备注
Proc. Interspeech 2020, 5 pages