中文

预测人-物交互:第一视角视频中运动注意与动作的联合预测

计算机视觉与模式识别 2020-07-21 v2

摘要

我们致力于解决第一视角视频中预测人-物交互这一具有挑战性的任务。大多数现有方法忽略相机佩戴者如何与物体交互,或仅将身体运动视为独立模态。相反,我们观察到手部运动揭示了关于未来活动的关键信息。受此启发,我们采用有意的手部运动作为未来表征,并提出一种新颖的深度网络,联合建模并预测自我中心手部运动、交互热点与未来动作。具体而言,我们将未来手部运动视为运动注意(motor attention),并在深度模型中使用潜变量对该注意进行建模。所预测的运动注意进一步用于刻画判别性的时空视觉特征,以预测动作与交互热点。我们给出了大量实验以证明所提联合模型的优势。重要的是,我们的模型在 EGTEA Gaze+ 与 EPIC-Kitchens 数据集上均取得了动作预测的新 SOTA 结果。我们的项目页面位于 https://aptx4869lm.github.io/ForecastingHOI/

关键词

引用

@article{arxiv.1911.10967,
  title  = {Forecasting Human-Object Interaction: Joint Prediction of Motor Attention and Actions in First Person Video},
  author = {Miao Liu and Siyu Tang and Yin Li and James Rehg},
  journal= {arXiv preprint arXiv:1911.10967},
  year   = {2020}
}