中文

VoiceMe:TTS 中的个性化语音生成

声音 2022-07-12 v2 人机交互 音频与语音处理

摘要

新颖的文本到语音(TTS)系统能够生成训练期间未见过的新语音。然而,从高维说话人空间中高效创建个性化语音仍是一项困难任务。本工作中,我们利用在最先进说话人验证模型(SpeakerNet,基于数千说话人训练)上的说话人嵌入来条件化一个 TTS 模型。我们采用人类采样范式来探索该说话人潜在空间。我们展示用户可创建与人脸照片、艺术肖像和卡通画契合良好的语音。我们招募在线参与者集体操控说话人脸的语音。我们表明:(1)独立的人类评分者确认所创语音与面孔匹配;(2)从面孔显现的说话人性别在语音中得到良好恢复;(3)人们持续朝着给定面孔的真实的语音原型移动。我们的结果表明该技术可广泛应用于包括有声读物和游戏中的角色语音开发、个性化语音助手以及为言语障碍者提供个人语音等大量场景。

关键词

引用

@article{arxiv.2203.15379,
  title  = {VoiceMe: Personalized voice generation in TTS},
  author = {Pol van Rijn and Silvan Mertes and Dominik Schiller and Piotr Dura and Hubert Siuzdak and Peter M. C. Harrison and Elisabeth André and Nori Jacoby},
  journal= {arXiv preprint arXiv:2203.15379},
  year   = {2022}
}

备注

Accepted to Interspeech'22. Audio and video samples are available at: https://polvanrijn.github.io/VoiceMe/