DAIEN-TTS:面向环境感知文本到语音合成的解耦音频填充
音频与语音处理
2026-01-21 v2 声音
摘要
本文提出了DAIEN-TTS,一种零样本文本到语音(TTS)框架,通过解耦音频填充实现环境感知合成。通过利用独立的说话人和环境提示,DAIEN-TTS允许对合成语音的音色和背景环境进行独立控制。该方法基于F5-TTS构建,所提出的DAIEN-TTS首先引入预训练的语音-环境分离(SES)模块,将环境语音解耦为干净语音和环境音频的mel频谱图。随后对两个mel频谱图施加长度不同的随机跨度掩码,这些掩码与文本嵌入一起作为填充被掩码环境mel频谱图的条件,使得个性化语音的延续与时变环境音频的同步进行成为可能。为进一步增强推理时的可控性,我们对语音和环境分量采用双无分类器引导(DCFG),并引入信噪比(SNR)自适应策略以使合成语音与环境提示对齐。实验结果表明,DAIEN-TTS能够生成具有高自然度、强说话人相似性和高环境保真度的环境个性化语音。
引用
@article{arxiv.2509.14684,
title = {DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis},
author = {Ye-Xin Lu and Yu Gu and Kun Wei and Hui-Peng Du and Yang Ai and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2509.14684},
year = {2026}
}
备注
Accepted by ICASSP 2026