WavTokenizer:面向音频语言建模的高效声学离散编解码器标记化器
音频与语音处理
2025-02-26 v3 机器学习
多媒体
声音
信号处理
摘要
语言模型已被有效应用于对自然信号的建模,如图像、视频、语音和音频。其关键组件是 codec tokenizer,将高维自然信号压缩为低维离散标记。在本文中,我们介绍了 WavTokenizer,相较于音频领域的先前SOTA声学编解码模型具有多个优势:1)极致压缩。通过压缩量化器层数和离散编解码器的时间维度,一秒24kHz采样率的音频仅需单个量化器的40或75个标记。2)改进的主观质量。尽管标记数量减少,WavTokenizer 仍实现了SOTA重建质量,UTMOS分数卓越,且天然包含更丰富的语义信息。我们通过设计更广的VQ空间、延长上下文窗口、改进注意力网络,以及引入强大的多尺度判别器和逆傅里叶变换结构来实现上述效果。我们在语音、音频和音乐等领域进行了大量重建实验。WavTokenizer 在各种客观和主观指标上均表现优异。我们还测试了语义信息、VQ利用率和对生成模型的适应性。全面的消融研究确认了 WavTokenizer 中每个模块的必要性。相关代码、演示和预训练模型均可在 https://github.com/jishengpeng/WavTokenizer 获取。
引用
@article{arxiv.2408.16532,
title = {WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling},
author = {Shengpeng Ji and Ziyue Jiang and Wen Wang and Yifu Chen and Minghui Fang and Jialong Zuo and Qian Yang and Xize Cheng and Zehan Wang and Ruiqi Li and Ziang Zhang and Xiaoda Yang and Rongjie Huang and Yidi Jiang and Qian Chen and Siqi Zheng and Zhou Zhao},
journal= {arXiv preprint arXiv:2408.16532},
year = {2025}
}
备注
Accepted by ICLR 2025