EmojiVoice:面向机器人语音长期可控表达性的突破
机器人学
2025-07-31 v2 人机交互
摘要
人类在持续发言时会调整表达方式,以维持与听者的持续互动。尽管社交机器人通常配备“表达性”且愉悦的语音,但缺乏人类语音中出现的长期变化。基础模型语音合成系统正在模仿人类语音的表达性,但难以在机器人上离线部署。我们提出 EmojiVoice,一个免费且可定制的文本到语音(TTS)工具包,允许社交机器人人构建在社交机器人上实现时序可变且具有表达性的语音。我们引入 emoji 提示技术,使其能在阶段层面精细控制表达性,并采用轻量级 Matcha-TTS Backbone 实现实时语音生成。我们探索了三个案例研究:(1)机器人助理的剧本化对话,(2)讲故事机器人,以及(3)自主语音到语音交互式智能体。我们发现,在讲故事任务中,使用 varied emoji 提示可提高长期语音的感知度和表达性,但在助理场景中,表达性语音并未被偏好。
引用
@article{arxiv.2506.15085,
title = {EmojiVoice: Towards long-term controllable expressivity in robot speech},
author = {Paige Tuttösí and Shivam Mehta and Zachary Syvenky and Bermet Burkanova and Gustav Eje Henter and Angelica Lim},
journal= {arXiv preprint arXiv:2506.15085},
year = {2025}
}
备注
Accepted to RO-MAN 2025, Demo at HRI 2025 : https://dl.acm.org/doi/10.5555/3721488.3721774 Project webpage here: https://rosielab.github.io/emojivoice/ Toolbox here: https://github.com/rosielab/emojivoice