DiEmo-TTS:通过自监督蒸馏解耦情感表征以实现文本到语音中的跨说话人情感迁移
声音
2025-10-20 v2 人工智能
音频与语音处理
摘要
语音合成中的跨说话人情感迁移依赖于提取与说话人无关的情感嵌入,以便在不保留说话人特征的情况下进行准确的情感建模。然而,现有的音色压缩方法无法完全分离说话人和情感特征,导致说话人信息泄露和合成质量下降。为了解决这一问题,我们提出了 DiEmo-TTS,一种自监督蒸馏方法,旨在最小化情感信息损失并保留说话人身份。我们引入了聚类驱动采样和信息扰动,以在去除无关因素的同时保留情感。为了促进这一过程,我们提出了一种利用情感属性预测和说话人嵌入的情感聚类与匹配方法,从而能够泛化至无标签数据。此外,我们设计了一个双条件 Transformer 来更好地整合风格特征。实验结果验证了我们的方法在学习与说话人无关的情感嵌入方面的有效性。
引用
@article{arxiv.2505.19687,
title = {DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech},
author = {Deok-Hyeon Cho and Hyung-Seok Oh and Seung-Bin Kim and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2505.19687},
year = {2025}
}
备注
Proceedings of Interspeech 2025