双人对话情境下 RGB 视频中共笑手势关系分析
计算机视觉与模式识别
2022-05-23 v1
摘要
虚拟代理的发展使人-化身交互变得日益丰富多样。此外,富有表现力的虚拟代理(即模仿自然情感表达)增强了用户(人)与代理(智能机器)之间的社交互动。因此,虚拟角色的非言语行为集合是人机交互情境中的重要组成部分。笑声不仅是一种音频信号,而是多模态非言语通信的内在关联,除音频外还包括面部表情和身体动作。运动分析通常依赖于相关的动作捕捉数据集,但主要问题在于此类数据集的获取昂贵且耗时。本工作研究双人对话中笑声与身体动作的关系。身体动作使用基于深度学习的姿态估计模型从视频中提取。我们发现,在所探究的 NDC-ME 数据集中,关节运动的单一统计特征(即最大值或傅里叶变换的最大值)与笑声强度的弱相关度为 30%。然而,我们未发现音频特征与身体动作之间的直接相关性。我们讨论了将此类数据集用于音频驱动的共笑动作合成任务的挑战。
引用
@article{arxiv.2205.10266,
title = {Analysis of Co-Laughter Gesture Relationship on RGB videos in Dyadic Conversation Contex},
author = {Hugo Bohy and Ahmad Hammoudeh and Antoine Maiorca and Stéphane Dupont and Thierry Dutoit},
journal= {arXiv preprint arXiv:2205.10266},
year = {2022}
}
备注
5 pages, 2 figures, 2 tables