面向动作识别的黎曼流形中层词学习
计算机视觉与模式识别
2015-11-17 v1
摘要
由于视频数据来源多样和类内差异大,人体动作识别仍是一项具有挑战性的任务。因此,探索有效且鲁棒的表示以应对此类挑战成为近期研究的关键问题之一。本文提出一种新颖的表示方法,通过构建视频中的中层词并在黎曼流形上对其进行编码。具体而言,我们首先对密集提取的低层特征进行全局对齐,以建立一组对应的特征组,其中每组可统计建模为位于特定黎曼流形上的中层词。基于这些中层词,我们采用K-Karcher均值聚类和黎曼高斯混合模型构建固有的黎曼码本,进而将欧氏空间中三种被广泛研究的编码方法,即视觉词袋(BoVW)、局部聚合描述子向量(VLAD)和费舍尔向量(FV),推广到黎曼流形版本,从而获得最终的动作视频表示。我们的方法在四个流行真实数据集上的两项任务中进行了评估:在YouTube、UCF50、HMDB51数据库上的动作识别,以及在ASLAN数据库上的动作相似性标注。在所有情况下,所报告的结果均与近期最先进的成果极具竞争力。
引用
@article{arxiv.1511.04808,
title = {Learning Mid-level Words on Riemannian Manifold for Action Recognition},
author = {Mengyi Liu and Ruiping Wang and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:1511.04808},
year = {2015}
}
备注
10 pages