TTS 中的任务向量:面向情感表达的方言语音合成
声音
2025-12-23 v1 机器学习
摘要
近期文本转语音 (TTS) 技术在自然度与可理解性方面取得了显著进展。基于此,研究正向情感表达性提升倾斜,例如方言 TTS 与情感 TTS。然而,跨风格合成(同时包含方言与情感) remains 挑战且鲜有探索,主要由于缺乏带情感标签的方言数据。为此,我们提出层次化表达向量 (HE-Vector),一种用于情感方言 TTS 的两阶段方法。在第一阶段,我们构建不同任务向量分别建模方言与情感风格,然后通过调整权重增强单一风格合成,我们称为表达向量 (E-Vector)。在第二阶段,我们层次化集成这些向量,以实现可控的情感方言合成,无需联合标注数据,即得到层次化表达向量 (HE-Vector)。实验结果表明,HE-Vector 在方言合成中表现优异,在零样态情感方言语音合成中取得有希望的结果。
引用
@article{arxiv.2512.18699,
title = {Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis},
author = {Pengchao Feng and Yao Xiao and Ziyang Ma and Zhikang Niu and Shuai Fan and Yao Li and Sheng Wang and Xie Chen},
journal= {arXiv preprint arXiv:2512.18699},
year = {2025}
}