基于动态块级预测策略的稳健高效自回归语音合成
声音
2025-06-30 v1 计算与语言
音频与语音处理
摘要
最近,自回归 (AR) 语言模型在语音合成领域取得了显著进展,提供了表达性强且可扩展的训练。然而,依赖于下一令牌预测范式的传统 AR 语音合成模型在处理长语音序列时常面临显著挑战。这些模型在构建稳定的帧到帧注意力方面常常困难,导致延迟增加和合成质量下降,从而限制了其在实时应用中的可行性。为解决这些限制,我们引入一种新颖的动态块级自回归合成框架,称为 DCAR,旨在增强 AR 语音生成的效率和可理解性鲁棒性。DCAR 通过采用多令牌预测进行训练,引入块到帧注意力机制,使其能够在可变的语音语境中使用轻量级模块进行动态块预测。DCAR 动态调整令牌预测跨度,显著减少序列长度依赖,同时获得高质量的合成效果。全面的经验评估表明,DCAR 显著优于传统的下一令牌预测模型,在测试集上实现了最高可达 72.27% 的可理解性提升和 2.61 倍的推理加速。此外,我们进行了全面的分析,以支持其作为下一代语音合成系统的通用基础。
引用
@article{arxiv.2506.22023,
title = {Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy},
author = {Bohan Li and Zhihan Li and Haoran Wang and Hanglei Zhang and Yiwei Guo and Hankun Wang and Xie Chen and Kai Yu},
journal= {arXiv preprint arXiv:2506.22023},
year = {2025}
}
备注
17 pages, 8 figures, 5 tables