从自我中心视频联合预测手部运动与交互热点
计算机视觉与模式识别
2022-04-05 v1 机器学习
摘要
我们提出在给定自我中心视频的情况下预测未来的手-物交互。与预测动作标签或像素不同,我们直接预测手部运动轨迹和下一活跃物体上的未来接触点(即交互热点)。这种相对低维的表征提供了对未来交互的具体描述。为应对该任务,我们首先提供一种在大规模数据上自动收集轨迹与热点标签的方法。随后我们使用该数据训练一个以物体为中心的 Transformer(OCT)模型进行预测。我们的模型通过 Transformer 中的自注意力机制进行手与物体交互推理。OCT 还提供概率框架以采样未来轨迹和热点,从而处理预测中的不确定性。我们在 Epic-Kitchens-55、Epic-Kitchens-100 和 EGTEA Gaze+ 数据集上开展实验,表明 OCT 以大幅优势显著超越最先进方法。项目页面见 https://stevenlsw.github.io/hoi-forecast。
引用
@article{arxiv.2204.01696,
title = {Joint Hand Motion and Interaction Hotspots Prediction from Egocentric Videos},
author = {Shaowei Liu and Subarna Tripathi and Somdeb Majumdar and Xiaolong Wang},
journal= {arXiv preprint arXiv:2204.01696},
year = {2022}
}
备注
CVPR 2022, Project page: https://stevenlsw.github.io/hoi-forecast