通过离散声学标记去噪提升LLM基零样本语音合成的噪声鲁棒性
音频与语音处理
2025-05-23 v2 声音
摘要
大语言模型(LLM)基于零样本的语音合成(TTS)方法倾向于保留音频提示中的声学环境,从而在音频提示包含噪声时导致合成语音质量下降。为此,本文提出一种新型基于神经编解码器的语音去噪器,并将其集成到先进的LLM-based TTS模型LauraTTS中,以实现面向噪声的零样本TTS。该编解码器去噪器由音频编解码器、标记去噪器和嵌入细化器组成。标记去噪器从带噪声的标记中预测前两组干净的声学标记,这些标记可作为LauraTTS的语音提示,用于合成高质量的个性化语音,或通过嵌入细化器和编解码器解码器转换为干净的语音波形。实验结果表明,本文提出的编解码器去噪器优于当前最先进的语音增强(SE)方法,而本文提出的面向噪声的LauraTTS还优于使用额外SE模型的方法。
引用
@article{arxiv.2505.13830,
title = {Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising},
author = {Ye-Xin Lu and Hui-Peng Du and Fei Liu and Yang Ai and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2505.13830},
year = {2025}
}
备注
Accepted by Interspeech 2025