中文

动作识别中的视觉词袋模型与融合方法:综合研究与最佳实践

计算机视觉与模式识别 2014-05-20 v1

摘要

基于视频的动作识别是计算机视觉研究中重要且具有挑战性的问题之一。带有局部特征的视觉词袋模型(BoVW)已成为最流行的方法,并在 HMDB51、UCF50 和 UCF101 等多个现实数据集上获得了最先进的性能。BoVW 是从一组局部特征构建全局表示的通用流程,主要由五个步骤组成:(i) 特征提取,(ii) 特征预处理,(iii) 码本生成,(iv) 特征编码,以及 (v) 池化与归一化。在不同场景下,人们已针对每个步骤独立做出了许多努力,但它们对动作识别的影响尚不清楚。同时,视频数据展现了视觉模式的不同视角,如静态外观和运动动态。通常会提取多种描述子来表示这些不同视角。许多特征融合方法已在其他领域得到开发,但它们对动作识别的影响此前从未被研究过。本文旨在对 BoVW 的所有步骤和不同的融合方法进行全面研究,并揭示一些产生最先进动作识别系统的最佳实践。具体而言,我们探索了两种局部特征、十种编码方法、八种池化和归一化策略以及三种融合方法。我们得出结论,每个步骤都对最终识别率至关重要。此外,基于我们的综合研究,通过探索不同 BoVW 框架和局部描述子的互补性,我们提出了一种简单而有效的表示,称为混合表示。使用这种表示,我们在三个具有挑战性的数据集上获得了最先进的结果:HMDB51 (61.1%)、UCF50 (92.3%) 和 UCF101 (87.9%)。

关键词

引用

@article{arxiv.1405.4506,
  title  = {Bag of Visual Words and Fusion Methods for Action Recognition: Comprehensive Study and Good Practice},
  author = {Xiaojiang Peng and Limin Wang and Xingxing Wang and Yu Qiao},
  journal= {arXiv preprint arXiv:1405.4506},
  year   = {2014}
}