TED-TTS:面向文本合成的训练自由的 utterance 内情感与时长控制
声音
2026-05-19 v2
摘要
虽然可控文本合成(TTS)取得了显著进展,但大多数现有方法仍受限于 utterance 级别控制,使得细粒度的 utterance 内表达具有挑战性 due to their reliance on non-public datasets or complex multi-stage training。本文提出 TED-TTS,一个用于预训练零样文本合成的训练自由可控框架,以实现 utterance 内情感与时长表达。具体而言,我们提出了基于因果遮蔽结合单调流对齐过滤的 segment-aware 情感条件策略,以隔离情感条件并调度遮蔽转换,实现平滑的 utterance 内情感变化 while preserving global 语义连贯性。基于此,我们进一步提出了 segment-aware 时长引导策略,以结合局部时长嵌入引导与全局 EOS logit 调制,实现局部时长调整 while ensuring 全局一致的终止。为消除 segment 级别手动提示工程的需求,我们构建了一个包含 30,000 样本的多情感和时长标注文本数据集,以实现基于大语言模型的自动提示构建。广泛的实验表明,我们的训练自由方法不仅在多情感和时长控制中实现了 utterance 内一致性的 SOTA,还保持了底层 TTS 模型的基线水平语音质量。代码与音频样本均已公开。
关键词
引用
@article{arxiv.2601.03170,
title = {TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis},
author = {Qifan Liang and Yuansen Liu and Ruixin Wei and Nan Lu and Junchuan Zhao and Ye Wang},
journal= {arXiv preprint arXiv:2601.03170},
year = {2026}
}
备注
24 pages, 9 figures, 7 tables, 3 lists