HiFi-Codec:用于高保真音频编解码器的分组残差向量量化
声音
2023-05-09 v2 音频与语音处理
摘要
音频编解码器模型作为将音频压缩为离散表示的关键技术,广泛应用于音频通信中。如今,音频编解码器模型作为中间表示日益用于生成领域。例如,AudioLM 是一种以 SoundStream 的离散表示作为训练目标的音频生成模型,而 VALL-E 采用 Encodec 模型作为辅助 TTS 任务的中间特征。尽管它们有用,两个挑战依然存在:(1) 由于缺乏公开可用的训练流程以及需要大规模数据与 GPU,训练这些音频编解码器模型可能困难;(2) 实现良好重建性能需要许多码本,这增加了生成模型的负担。在本研究中,我们提出一种分组残差向量量化(GRVQ)技术,并据此开发了一种仅需 4 个码本的新型高保真音频编解码器模型 HiFi-Codec。我们使用 LibriTTS、VCTK、AISHELL 等公开可用的 TTS 数据(总时长超 1000 小时)以 8 块 GPU 训练所有模型。实验结果表明,尽管仅需 4 个码本,HiFi-Codec 在重建性能上优于 Encodec。为促进音频编解码与生成研究,我们推出 AcademiCodec,首个提供 Encodec、SoundStream 和 HiFi-Codec 训练代码与预训练模型的开源音频编解码器工具包。代码与预训练模型见:\href{https://github.com/yangdongchao/AcademiCodec}{https://github.com/yangdongchao/AcademiCodec}
引用
@article{arxiv.2305.02765,
title = {HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec},
author = {Dongchao Yang and Songxiang Liu and Rongjie Huang and Jinchuan Tian and Chao Weng and Yuexian Zou},
journal= {arXiv preprint arXiv:2305.02765},
year = {2023}
}
备注
The second version of HiFi-Codec