与我互动:面向意图、态度与社交动作的协同 egocentric 预测
计算机视觉与模式识别
2025-05-09 v3 人机交互
摘要
为了高效的人机交互,智能体应主动识别其目标用户并为即将到来的交互做准备。我们将这一挑战性问题形式化为从智能体(ego-centric)视角联合预测某个用户意图(意向与态度)以及其将执行的动作的新任务。为此,我们提出了 SocialEgoNet——一个基于图的时空框架,利用层次化多任务学习方法利用任务之间的依赖关系。SocialEgoNet 使用从面部、手部和身体关键点中提取的整体骨架(即从面部、手部和身体的关键点)仅需 1 秒的视频输入即可实现高推理速度。为进行评估,我们在现有的 egocentric 人机交互数据集上添加了新的类别标签和边界框标注。在该增强后的数据集(称为 JPL-Social)上进行大量实验,显示出实时推理和优异性能(所有任务平均准确率:83.15%),显著优于多个竞争性基线方法。将在接受后公开额外的标注和代码。
关键词
引用
@article{arxiv.2412.16698,
title = {Interact with me: Joint Egocentric Forecasting of Intent to Interact, Attitude and Social Actions},
author = {Tongfei Bian and Yiming Ma and Mathieu Chollet and Victor Sanchez and Tanaya Guha},
journal= {arXiv preprint arXiv:2412.16698},
year = {2025}
}
备注
Accepted to ICME, 2025. Camera-ready Version