使第三人称技术识别第一人称视频中的动作
计算机视觉与模式识别
2019-10-18 v1
摘要
我们专注于来自第一人称视频的第一人称动作识别。与第三人称领域不同,研究者将第一人称动作分为两类:涉及手-物交互的动作和不涉及手-物交互的动作,并为这两类动作分别开发了技术。此外,有人认为用于第三人称动作识别的传统线索并不足够,因此使用了第一人称特有的特征,如头部运动和手持物体,来识别此类动作。与当前最优方法不同,我们证明了一个常规的双流卷积神经网络(CNN)与长短期记忆网络(LSTM)架构,其具有分别用于物体和运动的独立流,能够泛化到所有类别的第一人称动作。所提出的方法统一了所有动作类别学到的特征,使得该架构更加实用。一个重要观察是,我们注意到第一人称视频中可见物体的尺寸要小得多。我们表明,通过对帧进行裁剪和调整大小,使物体尺寸与 ImageNet 物体的尺寸相当,所提出模型的性能得到了提升。我们在标准数据集:GTEA、EGTEA Gaze+、HUJI、ADL、UTE 和 Kitchen 上的实验证明,我们的模型显著优于各种当前最优技术。
引用
@article{arxiv.1910.07766,
title = {Making Third Person Techniques Recognize First-Person Actions in Egocentric Videos},
author = {Sagar Verma and Pravin Nagar and Divam Gupta and Chetan Arora},
journal= {arXiv preprint arXiv:1910.07766},
year = {2019}
}
备注
5 pages, ICIP2018, code:https://github.com/sagarverma/ego_action_recognition