中文

从自我中心视频联合预测手部运动与交互热点

计算机视觉与模式识别 2022-04-05 v1 机器学习

摘要

我们提出在给定自我中心视频的情况下预测未来的手-物交互。与预测动作标签或像素不同,我们直接预测手部运动轨迹和下一活跃物体上的未来接触点(即交互热点)。这种相对低维的表征提供了对未来交互的具体描述。为应对该任务,我们首先提供一种在大规模数据上自动收集轨迹与热点标签的方法。随后我们使用该数据训练一个以物体为中心的 Transformer(OCT)模型进行预测。我们的模型通过 Transformer 中的自注意力机制进行手与物体交互推理。OCT 还提供概率框架以采样未来轨迹和热点,从而处理预测中的不确定性。我们在 Epic-Kitchens-55、Epic-Kitchens-100 和 EGTEA Gaze+ 数据集上开展实验,表明 OCT 以大幅优势显著超越最先进方法。项目页面见 https://stevenlsw.github.io/hoi-forecast。

关键词

引用

@article{arxiv.2204.01696,
  title  = {Joint Hand Motion and Interaction Hotspots Prediction from Egocentric Videos},
  author = {Shaowei Liu and Subarna Tripathi and Somdeb Majumdar and Xiaolong Wang},
  journal= {arXiv preprint arXiv:2204.01696},
  year   = {2022}
}

备注

CVPR 2022, Project page: https://stevenlsw.github.io/hoi-forecast