我知道你在听:面向人机交互的自适应语音
摘要
尽管社交机器人用于语言教学的应用已有探索,但针对语言教学机器人设计任务特定的合成语音仍存局限。鉴于语言是一种语言任务,这一局限可能对机器人在语言教学任务中的效果造成严重影响。我们通过三个贡献来弥补 L2 教学机器人语音的不足:1. 我们满足轻量且富有表达性的机器人语音需求。通过对 Matcha-TTS 进行微调,我们利用 emoji 提示创建一种展现时间轴上多样表达性的语音。该语音可以在有限计算资源下实时运行。通过案例研究,我们发现该语音更具表达性、更符合社交礼仪,且适合长时间的富有表达性语音,如故事讲述。2. 我们探索如何使机器人语音适应物理和社交环境,以便在各种位置部署语音。我们发现,在嘈杂和高能量环境中增加音高和语速,使机器人语音显得更合适,也让机器人看起来更能察觉其当前环境。3. 我们创建了一个为 L2 听众改进清晰度的英语 TTS 系统,利用已知的元音语言属性,针对这些听众难以理解的元音。我们采用数据驱动、感知为导向的方法,了解 L2 说话者如何通过时长线索来解释这些具有最小时长(长元音)和劲元音(短元音)的困难单词。我们发现,元音时长对 L2 听众的感知影响很大,并为 Matcha-TTS 创建了一个“L2 清晰模式”,该模式对紧迫元音进行拉伸,而不改变劲元音。我们的清晰模式被发现比基础 Matcha-TTS 更尊重、更易理解、更鼓励人,同时减少了这些困难紧迫/劲元音最小对的转录错误。
关键词
引用
@article{arxiv.2506.15107,
title = {I Know You're Listening: Adaptive Voice for HRI},
author = {Paige Tuttösí},
journal= {arXiv preprint arXiv:2506.15107},
year = {2025}
}
备注
PhD Thesis Simon Fraser University https://summit.sfu.ca/item/39353 Read the Room: IROS 2023, Mmm whatcha say?: INTERSPEECH 2024, Emojivoice: RO-MAN 2025, You sound a little tense: SSW 2025. Thesis presentation here: https://www.youtube.com/watch?v=9BcEwqYOMYI