中文

基于改进 RVQGAN 的高保真音频压缩

声音 2023-10-30 v2 机器学习 音频与语音处理

摘要

语言模型已成功用于对图像、语音和音乐等自然信号进行建模。这些模型的一个关键组件是高品质神经压缩模型,其能够将高维自然信号压缩为较低维的离散 token。为此,我们引入了一种高保真通用神经音频压缩算法,可将 44.1 KHz 音频以仅 8kbps 带宽压缩为 token,实现约 90 倍压缩。我们通过将高保真音频生成的进展与图像域中更优的向量量化技术,以及改进的对抗损失与重建损失相结合来实现这一点。我们使用单一的通用模型压缩所有域(语音、环境、音乐等),使其广泛适用于所有音频的生成建模。我们与竞争性的音频压缩算法进行比较,发现我们的方法显著优于它们。我们针对每个设计选择提供了详尽的消融实验,并开源了代码与训练好的模型权重。我们希望我们的工作能为下一代高保真音频建模奠定基础。

关键词

引用

@article{arxiv.2306.06546,
  title  = {High-Fidelity Audio Compression with Improved RVQGAN},
  author = {Rithesh Kumar and Prem Seetharaman and Alejandro Luebs and Ishaan Kumar and Kundan Kumar},
  journal= {arXiv preprint arXiv:2306.06546},
  year   = {2023}
}

备注

Accepted at NeurIPS 2023 (spotlight)