中文

基于相互信息引导的情感文本转语音

声音 2025-10-03 v1 人工智能 音频与语音处理

摘要

当前情感文本转语音(TTS)和风格迁移方法依赖参考编码器控制全局风格或情感向量,但未能捕捉参考语音中细微的声学细节。为此,我们提出一种新型情感TTS方法,实现细粒度音素级情感嵌入预测,同时解耦参考语音的内在属性。该方法采用风格解耦方法指导两个特征提取器,减少声 timbre 与情感特征之间的相互信息,从而有效分离参考语音中的 distinct 风格组件。实验结果表明,我们的方法在生成自然且情感丰富的语音方面优于基准TTS系统。本工作凸显了在提升情感TTS系统质量和灵活性方面,细粒度表征和解耦表示的潜力。

关键词

引用

@article{arxiv.2510.01722,
  title  = {Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement},
  author = {Jianing Yang and Sheng Li and Takahiro Shinozaki and Yuki Saito and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2510.01722},
  year   = {2025}
}

备注

In Proceedings of the 17th Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC 2025)