中文

创建听起来像非裔美国人的 TTS:指南、技术挑战与令人惊讶的评估

计算与语言 2024-03-19 v1 人机交互

摘要

用户界面和机器人中 AI 代理的形象以白人为主,这不仅体现在面部和皮肤特征上,也体现在它们使用的合成语音上。在本文中,我们在开发一个旨在听起来像一位受过良好教育、专业、无地域口音的非裔美国女性的美式英语文本转语音(TTS)系统的过程中,探索了我们在种族表征方面发现的一些意想不到的挑战。本文首先介绍了与非裔美国 IT 专业人士进行的焦点小组讨论的结果,在讨论中收集并探讨了创建具有代表性且合适的 TTS 系统的指南与挑战,随后讨论了 TTS 系统开发者面临的一些技术困难。然后,我们描述了两项针对美式英语说话者的研究,在这些研究中,参与者无法将正确的种族归属于非裔美国人 TTS 语音,同时却以压倒性优势正确识别出了具有相似质量的 TTS 系统的白人种族。与非裔美国 IT 工作者的焦点小组不仅证实了我们构建的非裔美国人语音的代表性,还表明这种令人惊讶的识别结果可能是由于非非裔美国人无法或将潜在偏见带入其中,从而无法将受过教育、非方言、听起来专业的语音与非裔美国人联系起来。

关键词

引用

@article{arxiv.2403.11209,
  title  = {Creating an African American-Sounding TTS: Guidelines, Technical Challenges,and Surprising Evaluations},
  author = {Claudio Pinhanez and Raul Fernandez and Marcelo Grave and Julio Nogima and Ron Hoory},
  journal= {arXiv preprint arXiv:2403.11209},
  year   = {2024}
}

备注

Full version including appendixes