使用恒定比特率标量量化的实时通信神经语音编码
音频与语音处理
2024-09-20 v2 声音
摘要
神经音频编码已成为一个活跃的研究方向,有望在经典编码技术无法达到的极低比特率下实现良好的音频质量。在此,端到端可训练的类自编码器模型代表了当前的技术水平,其中自编码器瓶颈处的离散表示是学习得到的。这使得输入音频信号的高效传输成为可能。神经编解码器学习到的离散表示通常是通过对神经编码器的输出应用量化器来生成的。在几乎所有最先进的神经音频编码方法中,该量化器均被实现为向量量化器(VQ),并且人们已花费大量精力来缓解该量化技术与神经音频编码器结合使用时的缺陷。在本文中,我们提出并分析了基于投影标量量化(SQ)的 VQ 的简单替代方案。这些量化技术不需要任何额外的损失函数、调度参数或码本存储,从而简化了神经音频编解码器的训练。对于实时语音通信应用,要求这些神经编解码器在低复杂度、低延迟和低比特率下运行。我们通过提出一种基于 SQ 和短时傅里叶变换(STFT)表示的新型因果网络架构来解决这些挑战。所提方法在极低复杂度和低比特率区间表现尤为出色。
引用
@article{arxiv.2405.08417,
title = {Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization},
author = {Andreas Brendel and Nicola Pia and Kishan Gupta and Lyonel Behringer and Guillaume Fuchs and Markus Multrus},
journal= {arXiv preprint arXiv:2405.08417},
year = {2024}
}