中文

通过离散声学标记去噪提升LLM基零样本语音合成的噪声鲁棒性

音频与语音处理 2025-05-23 v2 声音

摘要

大语言模型(LLM)基于零样本的语音合成(TTS)方法倾向于保留音频提示中的声学环境,从而在音频提示包含噪声时导致合成语音质量下降。为此,本文提出一种新型基于神经编解码器的语音去噪器,并将其集成到先进的LLM-based TTS模型LauraTTS中,以实现面向噪声的零样本TTS。该编解码器去噪器由音频编解码器、标记去噪器和嵌入细化器组成。标记去噪器从带噪声的标记中预测前两组干净的声学标记,这些标记可作为LauraTTS的语音提示,用于合成高质量的个性化语音,或通过嵌入细化器和编解码器解码器转换为干净的语音波形。实验结果表明,本文提出的编解码器去噪器优于当前最先进的语音增强(SE)方法,而本文提出的面向噪声的LauraTTS还优于使用额外SE模型的方法。

关键词

引用

@article{arxiv.2505.13830,
  title  = {Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising},
  author = {Ye-Xin Lu and Hui-Peng Du and Fei Liu and Yang Ai and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2505.13830},
  year   = {2025}
}

备注

Accepted by Interspeech 2025