利用分类器决策边界进行动作表示
计算机视觉与模式识别
2017-04-07 v1
摘要
大多数基于深度学习的动作识别模型被设计为在其短时间窗口内生成独立的预测,这些预测通常通过启发式方法聚合,从而为整个视频片段分配动作标签。鉴于并非视频中的所有帧都能表征潜在动作,对所有帧赋予同等重要性的池化方案可能是不利的。为了应对这一挑战,我们提出了一种名为 SVM pooling 的新型池化方案,其基于这样的理念:在 CNN 于所有时间窗口生成的特征包中,至少存在一个特征能够表征该动作。为此,我们学习一个决策超平面,将这一未知但有用的特征与其余特征分离开来。在 SVM 框架中应用多示例学习,我们使用该分离超平面的参数作为视频的描述符。由于这些参数与最大间隔框架中的支持向量直接相关,它们可作为 CNN 特征池化的鲁棒表示。我们设计了一个联合优化目标和一种高效的求解器,以针对每个视频学习这些超平面以及基于超平面的相应动作分类器。在标准 HMDB 和 UCF101 数据集上的实验展示了 SOTA 的性能。
引用
@article{arxiv.1704.01716,
title = {Action Representation Using Classifier Decision Boundaries},
author = {Jue Wang and Anoop Cherian and Fatih Porikli and Stephen Gould},
journal= {arXiv preprint arXiv:1704.01716},
year = {2017}
}