基于增量解耦的环境感知零样文本到语音合成
音频与语音处理
2024-12-24 v1
摘要
本文提出一种基于增量解耦的环境感知零样文本到语音 (TTS) 方法,称为 IDEA-TTS,能够在保持给定环境参考语音声学特征的同时,为不可见说话人合成语音。IDEA-TTS 采用 VITS 作为 TTS 主干。为了有效解耦环境、说话人和文本因素,我们提出了增量解耦过程,其中设计了环境估算器,首先将环境声谱图分解为环境掩码和增强声谱图。环境掩码随后由环境编码器处理,以提取环境嵌入,而增强声谱图则在说话人嵌入的条件下,促进后续解耦说话人和文本因素,后者通过来自环境语音的预训练环境鲁棒说话人编码器提取。最后,将说话人和环境嵌入条件输入解码器,用于环境感知语音生成。实验结果表明,IDEA-TTS 在环境感知 TTS 任务中取得优异性能,尤其在语音质量、说话人相似性和环境相似性方面表现突出。此外,IDEA-TTS 还能够实现声学环境转换任务,并取得最先进的性能。
引用
@article{arxiv.2412.16977,
title = {Incremental Disentanglement for Environment-Aware Zero-Shot Text-to-Speech Synthesis},
author = {Ye-Xin Lu and Hui-Peng Du and Zheng-Yan Sheng and Yang Ai and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2412.16977},
year = {2024}
}
备注
Accepted to ICASSP 2025