中文

一种用于动作识别的鲁棒高效视频表示

计算机视觉与模式识别 2015-04-22 v1

摘要

本文介绍了一种最先进的视频表示方法,并将其应用于高效的动作识别与检测。我们首先提出通过显式相机运动估计来改进流行的稠密轨迹特征。具体而言,我们利用 SURF 描述符和稠密光流提取帧间的特征点匹配。这些匹配用于通过 RANSAC 估计单应性矩阵。为了提高单应性估计的鲁棒性,我们采用人体检测器去除来自人体的异常匹配,因为人体运动不受相机约束。与单应性一致的轨迹被视为由相机运动引起,因此被移除。我们还利用单应性矩阵从光流中消除相机运动。这使得基于运动的 HOF 和 MBH 描述符得到了显著改善。我们进一步探索了最近的 Fisher 向量作为标准词袋直方图的替代特征编码方法,并考虑了在这些编码中包含空间布局信息的不同方式。我们进行了大量且多样的评估,包括 (i) 六个数据集上短基本动作的分类,(ii) 长片电影中此类动作的定位,以及 (iii) 复杂事件的大规模识别。我们发现,改进后的轨迹特征显著优于之前的稠密轨迹,且对于视频识别任务,Fisher 向量优于词袋编码。在所有三项任务中,我们都展示了相对于最先进结果的显著提升。

关键词

引用

@article{arxiv.1504.05524,
  title  = {A robust and efficient video representation for action recognition},
  author = {Heng Wang and Dan Oneata and Jakob Verbeek and Cordelia Schmid},
  journal= {arXiv preprint arXiv:1504.05524},
  year   = {2015}
}