使用判别性池化的视频表示学习
计算机视觉与模式识别
2018-04-02 v2
摘要
流行的视频动作识别深度模型对短视频片段生成独立的预测,然后通过启发式方法将它们池化以将动作标签分配给整个视频段。由于并非所有帧都能表征潜在的动作——实际上,许多帧在多个动作中是共有的——对所有帧赋予同等重要性的池化方案可能是不利的。为了解决这个问题,我们提出了判别性池化,其基于这样的理念:在所有短视频片段生成的深度特征中,至少有一个能够表征该动作。为此,我们学习一个(非线性)超平面,将这个未知但具判别性的特征与其余特征分离开来。在大间隔设置下应用多示例学习,我们使用这个分离超平面的参数作为整个视频段的描述符。由于这些参数与最大间隔框架中的支持向量直接相关,它们可作为特征池化的鲁棒表示。我们构建了一个联合目标和一种高效的求解器,为每个视频学习这些超平面以及超平面上对应的动作分类器。我们的池化方案在深度框架内是端到端可训练的。我们报告了在三个涵盖各种挑战的基准数据集上的实验结果,并展示了在这些任务上的 SOTA 性能。
引用
@article{arxiv.1803.10628,
title = {Video Representation Learning Using Discriminative Pooling},
author = {Jue Wang and Anoop Cherian and Fatih Porikli and Stephen Gould},
journal= {arXiv preprint arXiv:1803.10628},
year = {2018}
}
备注
8 pages, 7 figures, Accepted in CVPR2018. arXiv admin note: substantial text overlap with arXiv:1704.01716