中文

用于第一人称视频动作预测的滚动-展开 LSTM

计算机视觉与模式识别 2020-05-11 v2

摘要

本文致力于解决以自我为中心的动作预测问题,即预测摄像佩戴者在不久的将来将执行哪些动作以及将与哪些物体交互。具体而言,我们提出了 Rolling-Unrolling LSTM,一种用于从以自我为中心的视频中预测动作的学习架构。该方法基于三个组成部分:1)一个由两个 LSTM 组成的架构,用于对总结过去和推断未来的子任务进行建模;2)一种序列补全预训练技术,鼓励 LSTM 专注于不同的子任务;3)一种模态注意力(MATT)机制,用于高效融合通过处理 RGB 帧、光流场和基于物体的特征所执行的多模态预测。所提出的方法在 EPIC-Kitchens、EGTEA Gaze+ 和 ActivityNet 上进行了验证。实验表明,所提出的架构在以自我为中心的视频领域达到了最先进水平,在 2019 年 EPIC-Kitchens 以自我为中心的动作预测挑战赛中取得了顶级性能。该方法在 ActivityNet 上也取得了相对于未基于无监督预训练的方法而言具有竞争力的性能,并能泛化到早期动作识别和动作识别任务。为鼓励对这一具有挑战性课题的研究,我们在网页上公开了代码、训练好的模型和预提取的特征:http://iplab.dmi.unict.it/rulstm。

关键词

引用

@article{arxiv.2005.02190,
  title  = {Rolling-Unrolling LSTMs for Action Anticipation from First-Person Video},
  author = {Antonino Furnari and Giovanni Maria Farinella},
  journal= {arXiv preprint arXiv:2005.02190},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:1905.09035