面向语音生成的压缩至精细语言建模的语音 Token 预测
音频与语音处理
2025-06-02 v1
摘要
作为语音分词器,神经音频编解码器在语音生成领域展现出了巨大的潜力。然而,为了确保高保真音频重建,神经音频编解码器通常将音频编码为长序列的语音 token,这对下游语言模型的长上下文建模构成了重大挑战。我们观察到,语音 token 序列表现出短程依赖性:由于文本到语音(TTS)任务中文本与语音之间的单调对齐,当前 token 的预测主要依赖于其局部上下文,而长程 token 对当前 token 预测的贡献较小,且通常包含冗余信息。受此观察启发,我们提出了一种压缩至精细语言建模方法,以解决神经编解码器语言模型中长序列语音 token 的挑战:(1)精细初始与短程信息:我们的方法在预测期间保留提示和局部 token,以确保文本对齐和副语言信息的完整性;(2)压缩长程上下文:我们的方法将长程 token 跨度压缩为紧凑表示,以减少冗余信息,同时保留基本语义。在各种神经音频编解码器和下游语言模型上的大量实验验证了所提方法的有效性和泛化能力,突出了 token 压缩在改进神经编解码器语言模型内语音生成中的重要性。音频样本演示可在 https://anonymous.4open.science/r/SpeechTokenPredictionViaCompressedToFinedLM 获取。
引用
@article{arxiv.2505.24496,
title = {Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation},
author = {Wenrui Liu and Qian Chen and Wen Wang and Yafeng Chen and Jin Xu and Zhifang Guo and Guanrou Yang and Weiqin Li and Xiaoda Yang and Tao Jin and Minghui Fang and Jialong Zuo and Bai Jionghao and Zemin Liu},
journal= {arXiv preprint arXiv:2505.24496},
year = {2025}
}