用于第一人称视频动作预测的 SlowFast 滚动-展开 LSTM
计算机视觉与模式识别
2021-09-03 v1 人工智能
机器学习
摘要
由于人类动作固有的多模态特性,第一人称视频中的动作预测是一项困难任务。此外,某些动作的发生快于或慢于其他动作,这取决于每次可能变化的行为者或周围上下文,并导致不同的预测。基于这一思想,我们在专为预测人类动作而设计的 RULSTM 架构基础上,提出了一种新颖的基于注意力的技术,用于同时评估从 RGB、光流和提取物体这三种不同模态中提取的慢速与快速特征。两个分支以不同的时间尺度(即帧率)处理信息,并考虑了多种融合方案以提高预测精度。我们在 EpicKitchens-55 和 EGTEA Gaze+ 数据集上进行了大量实验,并证明我们的技术在多个预测时间点上系统性地提升了 RULSTM 架构的 Top-5 准确率指标结果。
引用
@article{arxiv.2109.00829,
title = {SlowFast Rolling-Unrolling LSTMs for Action Anticipation in Egocentric Videos},
author = {Nada Osman and Guglielmo Camporese and Pasquale Coscia and Lamberto Ballan},
journal= {arXiv preprint arXiv:2109.00829},
year = {2021}
}
备注
Accepted to EPIC@ICCV 2021