中文

面部表情增强的 TTS:结合面部表征与情感强度实现自适应语音

声音 2024-09-25 v1 人工智能 音频与语音处理

摘要

我们提出了 FEIM-TTS,一种创新的零样本文本到语音(TTS)模型,能够合成与面部图像对齐并由情感强度调节的富有情感表现力的语音。借助深度学习,FEIM-TTS 超越了传统的 TTS 系统,无需依赖带标签的数据集即可解读面部线索并适应情感细微差别。为解决视听情感数据稀疏的问题,该模型使用 LRS3、CREMA-D 和 MELD 数据集进行训练,展示了其适应性。FEIM-TTS 生成高质量、与说话人无关的语音的独特能力,使其适合为虚拟角色创建可适应的声音。此外,FEIM-TTS 显著增强了视力障碍或视障人士的无障碍体验。通过将情感细微差别整合到 TTS 中,我们的模型为条漫实现了动态且引人入胜的听觉体验,使视障用户能够更充分地享受这些叙事。综合评估证明了其在调节情感和强度方面的熟练度,推动了情感语音合成和无障碍技术的发展。样本可在以下网址获取:https://feim-tts.github.io/。

关键词

引用

@article{arxiv.2409.16203,
  title  = {Facial Expression-Enhanced TTS: Combining Face Representation and Emotion Intensity for Adaptive Speech},
  author = {Yunji Chu and Yunseob Shim and Unsang Park},
  journal= {arXiv preprint arXiv:2409.16203},
  year   = {2024}
}

备注

13 pages, 3 figures, accepted to ECCV Workshop ABAW(Affective Behavior Analysis in-the-wild)7 (to be appear)