中文

FaceSpeak: 从不同风格的人类肖像生成表达且高质量的语音

声音 2025-04-17 v2 人工智能 音频与语音处理

摘要

人类能够通过外貌感知说话者的特征(如身份、性别、性格和情感),这些特征通常与其语音风格相一致。最近,视觉驱动的文本语音合成(TTS)研究者基于真实人脸进行研究,从而限制了有效语音合成仅能应用于有限的场景和多样化人物/图像风格。为解决这一问题,我们引入一种新颖的 FaceSpeak 方法。它从广泛多样的图像风格中提取显著的身份特征和情感表征,同时消除背景、服装和发色等多余信息,从而实现与人物形象相符的语音合成。此外,为克服多模态 TTS 数据稀缺的问题,我们设计了一种创新的数据集,即 Expressive Multi-Modal TTS,该数据集经过精心挑选和标注,以促进该领域的研究。实验结果表明,我们提出的 FaceSpeak 能生成与肖像相符的语音,具有令人满意的自然度和质量。

关键词

引用

@article{arxiv.2501.03181,
  title  = {FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles},
  author = {Tian-Hao Zhang and Jiawei Zhang and Jun Wang and Xinyuan Qian and Xu-Cheng Yin},
  journal= {arXiv preprint arXiv:2501.03181},
  year   = {2025}
}

备注

Accepted by AAAI 2025