XY-Tokenizer:缓解低比特率语音编解码器中的语义-声学冲突
声音
2025-07-10 v2 人工智能
音频与语音处理
摘要
语音编解码器作为语音信号与大语言模型之间的桥梁。理想的语音语言模型编解码器不仅要保留声学信息,还要捕获丰富的语义信息。然而,现有的语音编解码器在语义丰富性和声学保真度之间难以取得平衡。本研究分析了前述编解码器在平衡语义丰富性和声学保真度方面的局限性。我们提出了 XY-Tokenizer,一种通过多阶段、多任务学习来缓解语义与声学能力之间冲突的新型编解码器。实验结果表明,XY-Tokenizer 在语义和声学任务上的性能与相似比特率下的领先编解码器相当,尽管这些现有编解码器通常只在单一方面表现突出。具体而言,XY-Tokenizer 实现了强大的文本对齐能力,超越了基于蒸馏的语义建模方法如 SpeechTokenizer 和 Mimi,同时保持了重建音频与原始音频之间的说话人相似度为 0.83。XY-Tokenizer 的重建性能与当前声学专用编解码器 BigCodec 相当,后者在相似比特率下实现说话人相似度为 0.84。代码和模型已在 https://github.com/gyt1145028706/XY-Tokenizer 上提供。
引用
@article{arxiv.2506.23325,
title = {XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs},
author = {Yitian Gong and Luozhijie Jin and Ruifan Deng and Dong Zhang and Xin Zhang and Qinyuan Cheng and Zhaoye Fei and Shimin Li and Xipeng Qiu},
journal= {arXiv preprint arXiv:2506.23325},
year = {2025}
}