中文

基于支持向量分类器的判别性视频表示学习

计算机视觉与模式识别 2019-09-09 v1

摘要

当前用于视频动作识别的主流深度模型通常对短视频片段生成独立预测,再通过启发式池化方法为整个视频片段分配动作标签。由于并非所有帧都能表征底层动作——许多帧在多个动作间是共通的——对所有帧施加同等重要性的池化方案可能并不理想。为解决这一问题,我们提出判别性池化方法,其核心思想是:在所有短视频片段生成的深度特征中,至少存在一个能够表征该动作的特征。为识别这些有用特征,我们引入一个由已知不相关特征构成的负包,例如,这些特征采样自与我们所关注动作无关的数据集,或以随机噪声作为输入生成的CNN特征。将视频中的特征作为正包,不相关特征作为负包,我们在支持向量机框架下,通过多示例学习形式构建目标函数,学习一个(非线性)超平面,将未知的有用特征与其余特征分离开。我们使用该分离超平面的参数作为整个视频片段的描述符。由于这些参数在最大间隔框架中与支持向量直接相关,它们可被视为对包中特征进行加权平均池化的结果,其中非支持向量的权重为零。我们的池化方案可在深度学习框架内进行端到端训练。我们报告了在涵盖多种视频相关任务的八个计算机视觉基准数据集上的实验结果,并在这些任务上展示了最先进的性能。

关键词

引用

@article{arxiv.1909.02856,
  title  = {Discriminative Video Representation Learning Using Support Vector Classifiers},
  author = {Jue Wang and Anoop Cherian},
  journal= {arXiv preprint arXiv:1909.02856},
  year   = {2019}
}

备注

arXiv admin note: substantial text overlap with arXiv:1803.10628