主动听者: dyadic 互动中听者头部运动的连续生成
机器人学
2024-10-01 v1 声音
音频与语音处理
摘要
dyadic 口语互动的关键组成部分是与说话者情境相关的非语言手势,例如头部动作可反映听者对说话者言语的响应。尽管在生成伴说手势方面取得了显著进展,但生成听者响应仍然是一个挑战。我们提出了在说话者说话时,实时生成听者头部姿态角(roll、pitch、yaw)的任务。为此,我们提出了一种基于图的端到端跨模态模型,该模型以说话者的语音为输入,实时生成听者的头部姿态角。与以往工作不同,我们的方法完全数据驱动,不需要手动标注,也不将头部运动简化为仅仅的点头或摇头。在IEMOCAP数据集上的dyadic互动会话进行的大规模评估表明,我们的模型产生了低整体误差(4.5度)和高帧率,表明其可部署于实际的人机交互系统中。我们的代码可在 https://github.com/bigzen/Active-Listener 上获取。
引用
@article{arxiv.2409.20188,
title = {Active Listener: Continuous Generation of Listener's Head Motion Response in Dyadic Interactions},
author = {Bishal Ghosh and Emma Li and Tanaya Guha},
journal= {arXiv preprint arXiv:2409.20188},
year = {2024}
}
备注
4+1 pages, 3 figures, 2 tables