中文

用于第一人称视频动作预测的 SlowFast 滚动-展开 LSTM

计算机视觉与模式识别 2021-09-03 v1 人工智能 机器学习

摘要

由于人类动作固有的多模态特性,第一人称视频中的动作预测是一项困难任务。此外,某些动作的发生快于或慢于其他动作,这取决于每次可能变化的行为者或周围上下文,并导致不同的预测。基于这一思想,我们在专为预测人类动作而设计的 RULSTM 架构基础上,提出了一种新颖的基于注意力的技术,用于同时评估从 RGB、光流和提取物体这三种不同模态中提取的慢速与快速特征。两个分支以不同的时间尺度(即帧率)处理信息,并考虑了多种融合方案以提高预测精度。我们在 EpicKitchens-55 和 EGTEA Gaze+ 数据集上进行了大量实验,并证明我们的技术在多个预测时间点上系统性地提升了 RULSTM 架构的 Top-5 准确率指标结果。

关键词

引用

@article{arxiv.2109.00829,
  title  = {SlowFast Rolling-Unrolling LSTMs for Action Anticipation in Egocentric Videos},
  author = {Nada Osman and Guglielmo Camporese and Pasquale Coscia and Lamberto Ballan},
  journal= {arXiv preprint arXiv:2109.00829},
  year   = {2021}
}

备注

Accepted to EPIC@ICCV 2021