零样本文本到语音中的词级情感表达控制
音频与语音处理
2026-01-13 v2 声音
摘要
尽管情感文本到语音(TTS)取得了显著进展,但大多数现有研究仅限于句子级情感表达,无法支持词级控制。实现词级表达控制面临根本性挑战,主要源于多情感转换的复杂建模以及捕捉句内情感和韵律变化的标注数据稀缺。在本文中,我们提出 WeSCon,首个实现在预训练零样本 TTS 模型中进行词级情感和说话速度控制的自训练框架,无需包含句内情感或速度转换的数据集。我们的方法引入了过渡平滑策略和动态速度控制机制,通过多轮推理过程引导预训练 TTS 模型完成词级表达合成。为进一步简化推理,我们采用动态情感注意力偏置机制,通过自训练微调模型,以端到端方式激活其进行词级表达控制能力。实验结果表明,WeSCon 有效克服了数据稀缺问题,实现了在保持原始 TTS 模型强大零样本合成能力的同时,实现词级情感表达控制的领先性能。
引用
@article{arxiv.2509.24629,
title = {Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis},
author = {Tianrui Wang and Haoyu Wang and Meng Ge and Cheng Gong and Chunyu Qiang and Ziyang Ma and Zikang Huang and Guanrou Yang and Xiaobao Wang and Eng Siong Chng and Xie Chen and Longbiao Wang and Jianwu Dang},
journal= {arXiv preprint arXiv:2509.24629},
year = {2026}
}