中文

DAIEN-TTS:面向环境感知文本到语音合成的解耦音频填充

音频与语音处理 2026-01-21 v2 声音

摘要

本文提出了DAIEN-TTS,一种零样本文本到语音(TTS)框架,通过解耦音频填充实现环境感知合成。通过利用独立的说话人和环境提示,DAIEN-TTS允许对合成语音的音色和背景环境进行独立控制。该方法基于F5-TTS构建,所提出的DAIEN-TTS首先引入预训练的语音-环境分离(SES)模块,将环境语音解耦为干净语音和环境音频的mel频谱图。随后对两个mel频谱图施加长度不同的随机跨度掩码,这些掩码与文本嵌入一起作为填充被掩码环境mel频谱图的条件,使得个性化语音的延续与时变环境音频的同步进行成为可能。为进一步增强推理时的可控性,我们对语音和环境分量采用双无分类器引导(DCFG),并引入信噪比(SNR)自适应策略以使合成语音与环境提示对齐。实验结果表明,DAIEN-TTS能够生成具有高自然度、强说话人相似性和高环境保真度的环境个性化语音。

关键词

引用

@article{arxiv.2509.14684,
  title  = {DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis},
  author = {Ye-Xin Lu and Yu Gu and Kun Wei and Hui-Peng Du and Yang Ai and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2509.14684},
  year   = {2026}
}

备注

Accepted by ICASSP 2026