面向可扩展神经语音编码的跨尺度矢量量化
声音
2022-07-08 v1 机器学习
音频与语音处理
摘要
比特率可扩展性是实时通信中音频编码的理想特性。现有的神经音频编解码器通常在训练期间强制使用特定比特率,因此需要为每个目标比特率训练不同的模型,这增加了发送端和接收端的内存占用,并且通常需要转码来支持多个接收端。在本文中,我们引入了一种跨尺度可扩展矢量量化方案(CSVQ),其中多尺度特征通过逐步的特征融合和细化进行渐进式编码。通过这种方式,如果只接收到部分比特流,则可以重建粗级别的信号,并且随着更多比特可用,质量会逐步提高。所提出的 CSVQ 方案可以灵活地应用于任何具有镜像自编码器结构的神经音频编码网络,以实现比特率可扩展性。主观结果表明,所提出的方案优于具有可扩展性的经典残差矢量量化(RVQ)。此外,所提出的 CSVQ 在 3 kbps 下优于 9 kbps 的 Opus 和 3 kbps 的 Lyra,并且可以随着比特率的增加提供优雅的质量提升。
引用
@article{arxiv.2207.03067,
title = {Cross-Scale Vector Quantization for Scalable Neural Speech Coding},
author = {Xue Jiang and Xiulian Peng and Huaying Xue and Yuan Zhang and Yan Lu},
journal= {arXiv preprint arXiv:2207.03067},
year = {2022}
}
备注
INTERSPEECH 2022(Accepted)