TaDiCodec:面向语音语言建模的文本感知扩散语音标记器
声音
2025-08-26 v1 机器学习
音频与语音处理
摘要
语音标记器是语音语言模型的基础组件,但现有设计存在若干局限,包括:1)依赖多层残差向量量化结构或高帧率,2)依赖用于语义蒸馏的辅助预训练模型,3)需要复杂的两阶段训练流程。本文引入了文本感知扩散Transformer语音编解码器(TaDiCodec),一种新方法旨�克服上述挑战。TaDiCodec 通过扩散自编码器实现量化与重构的端到端优化,同时将文本引导集成到扩散解码器中,以提升重构质量并实现最佳压缩。TaDiCodec 实现了极低的 6.25 Hz 帧率,对应 0.0875 kbps 的比特率,仅使用单层码本即可处理 24 kHz 语音,同时在关键语音生成评估指标上表现优异,包括字错率(WER)、说话人相似度(SIM)和语音质量(UTMOS)。值得注意的是,TaDiCodec 采用单阶段、端到端训练范式,无需辅助预训练模型。我们还验证了 TaDiCodec 在基于语言模型的零样本文本到语音中的兼容性,适用于自回归建模和掩码生成建模,显示其在语音语言建模中有效且高效,重构-生成间隙显著减小。我们将开源代码和模型检查点。音频样本可在 https:/tadicodec.github.io/ 获取。我们在 https:/github.com/HeCheng0625/Diffusion-Speech-Tokenizer 上发布代码和模型检查点。
引用
@article{arxiv.2508.16790,
title = {TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling},
author = {Yuancheng Wang and Dekun Chen and Xueyao Zhang and Junan Zhang and Jiaqi Li and Zhizheng Wu},
journal= {arXiv preprint arXiv:2508.16790},
year = {2025}
}