你预期什么?利用滚动-展开LSTM与模态注意力预测第一人称动作
计算机视觉与模式识别
2019-08-07 v2 人工智能
摘要
第一人称动作预测旨在理解相机佩戴者在不久的将来会与哪些物体交互以及将执行哪些动作。我们提出一种能够利用两个LSTM在多个时间尺度上预测动作的架构,以1)总结过去,以及2)对未来做出预测。输入视频通过三种互补模态进行处理:外观(RGB)、运动(光流)和物体(基于物体的特征)。模态特定的预测使用一种新颖的模态注意力(MATT)机制进行融合,该机制以自适应方式学习对模态进行加权。在两个大规模基准数据集上的广泛评估表明,我们的方法在包含超过2500个动作的具有挑战性的EPIC-Kitchens数据集上比先前最佳方法高出至多+7%,并可泛化到EGTEA Gaze+。我们的方法还被证明可泛化到早期动作识别和动作识别任务。我们的方法在2019年EPIC-Kitchens第一人称动作预测挑战赛的公开排行榜上排名第一。请参阅我们的网页获取代码和示例:http://iplab.dmi.unict.it/rulstm - https://github.com/fpv-iplab/rulstm。
引用
@article{arxiv.1905.09035,
title = {What Would You Expect? Anticipating Egocentric Actions with Rolling-Unrolling LSTMs and Modality Attention},
author = {Antonino Furnari and Giovanni Maria Farinella},
journal= {arXiv preprint arXiv:1905.09035},
year = {2019}
}
备注
Accepted as oral to ICCV [International Conference on Computer Vision] 2019