面向第一人称视频的池化运动特征
计算机视觉与模式识别
2015-05-07 v2
摘要
本文提出了一种面向第一人称视频的新特征表示。在第一人称视频理解(如活动识别)中,同时捕捉整个场景动态(即自运动)和视频中观察到的显著局部运动至关重要。我们描述了一种基于时间序列池化的表示框架,旨在抽象特征描述子元素的短期/长期变化。其思想是跟踪描述子值随时间的变化并将其汇总,以表示活动视频中的运动。该框架具有通用性,可处理任何类型的逐帧特征描述子,包括传统运动描述子如光流直方图(HOF),以及来自较新卷积神经网络(CNN)的外观描述子。我们通过实验证实,在使用相同底层特征描述子时,我们的方法明显优于以往的特征表示,包括视觉词袋和改进的 Fisher 向量(IFV)。我们还证实,在处理第一人称视频时,我们的特征表示性能优于现有的最先进特征,如局部时空特征和改进的轨迹特征(最初为第三人称视频开发)。在多种设置下对多个第一人称活动数据集进行了测试,以确认这些发现。
引用
@article{arxiv.1412.6505,
title = {Pooled Motion Features for First-Person Videos},
author = {M. S. Ryoo and Brandon Rothrock and Larry Matthies},
journal= {arXiv preprint arXiv:1412.6505},
year = {2015}
}