两全其美:结合数据独立与数据驱动方法用于动作识别
计算机视觉与模式识别
2015-05-19 v1
摘要
受数据驱动的卷积神经网络(CNNs)在静态图像物体识别上成功的鼓舞,研究者正努力开发用于学习视频特征的CNN等价模型。然而,由于高维度、缺乏标注数据以及处理大规模视频数据的困难,全局学习视频特征被证明颇具挑战。因此,我们提议利用数据驱动和数据独立方法中的有效技术来改进动作识别系统。我们的贡献有三方面。首先,我们提出双流堆叠卷积独立子空间分析(ConvISA)架构,表明无监督学习方法能显著提升从数据独立模型提取的传统局部特征性能。第二,我们证明通过在Improved Dense Trajectory (IDT)检测的视频体块上学习,我们可以无缝地将我们的新局部描述符与手工描述符结合。从而可利用为手工描述符开发的现有特征增强技术。最后,类似于CNN中的多类分类框架,我们提出一种免训练重排序技术,利用动作类间关系改善整体性能。我们在四个基准动作识别数据集上的实验结果展示了显著改进的性能。
引用
@article{arxiv.1505.04427,
title = {The Best of Both Worlds: Combining Data-independent and Data-driven Approaches for Action Recognition},
author = {Zhenzhong Lan and Dezhong Yao and Ming Lin and Shoou-I Yu and Alexander Hauptmann},
journal= {arXiv preprint arXiv:1505.04427},
year = {2015}
}