基于视频增强技术的多人人机交互联合参与度分类
计算机视觉与模式识别
2023-01-02 v1
摘要
情感理解能力对于社交机器人以直观且互惠的方式与一组用户自主交互至关重要。然而,多人情感理解的挑战不仅在于准确感知每位用户的状态(如参与度),还在于识别成员之间的情感交互(如联合参与度),其表现为复杂而微妙的非语言交流。本文提出一种新颖的混合框架,通过结合深度学习框架与多种视频增强技术来识别亲子二人组的联合参与度。利用一个亲子二人组在家与社交机器人共同阅读绘本的数据集,我们首先在应用了四种视频增强技术(General Aug、DeepFake、CutOut 和 Mixed)的数据集上训练基于 RGB 帧和骨架的联合参与度识别模型,以提升联合参与度分类性能。其次,我们展示了在机器人-家长-儿童交互情境下使用训练模型的实验结果。第三,我们引入一种基于行为的度量来评估模型学习到的表征,以探究模型在识别联合参与度时的可解释性。本工作作为全面释放端到端视频理解模型潜力(这些模型在大型公开数据集上预训练,并通过数据增强与可视化技术增强)用于真实场景下多人人机交互中情感识别的第一步。
引用
@article{arxiv.2212.14128,
title = {Joint Engagement Classification using Video Augmentation Techniques for Multi-person Human-robot Interaction},
author = {Yubin Kim and Huili Chen and Sharifa Alghowinem and Cynthia Breazeal and Hae Won Park},
journal= {arXiv preprint arXiv:2212.14128},
year = {2023}
}