中文

生成多语言性别模糊的文本转语音声音

声音 2023-06-13 v3 计算与语言 机器学习 音频与语音处理

摘要

任何语音用户界面的性别都是其感知身份的关键要素。近来,性别模糊而非明确为女性或男性的界面日益受到关注。本工作致力于在多说话人、多语言设定下生成新颖的性别模糊 TTS 声音。这是通过所提出的性别感知方法从潜说话人嵌入空间中高效采样来实现的。大量客观与主观评估明确表明,该方法能够高效生成一系列新颖、多样的声音,这些声音具有一致性,且在所有考察的语言中比基线声音更被感知为性别模糊。有趣的是,性别感知被发现对听者的两个人口统计因素——母语与性别——均具有鲁棒性。据我们所知,这是首个能够可靠生成多种性别模糊声音的系统化且经验证的方法。

关键词

引用

@article{arxiv.2211.00375,
  title  = {Generating Multilingual Gender-Ambiguous Text-to-Speech Voices},
  author = {Konstantinos Markopoulos and Georgia Maniati and Georgios Vamvoukakis and Nikolaos Ellinas and Georgios Vardaxoglou and Panos Kakoulidis and Junkwang Oh and Gunu Jho and Inchul Hwang and Aimilios Chalamandaris and Pirros Tsiakoulis and Spyros Raptis},
  journal= {arXiv preprint arXiv:2211.00375},
  year   = {2023}
}

备注

Accepted to INTERSPEECH 2023