判别式学习的层次化秩池化网络
计算机视觉与模式识别
2017-05-31 v1
摘要
在这项工作中,我们通过两种方式扩展无监督的秩池化时序编码方法,提出了用于动作和活动分类的新型时序编码方法。首先,我们提出了“判别式秩池化”,其中视频表示的共享权重和动作分类器的参数通过双层优化形式的学习问题,在给定的标记向量序列训练数据集上联合估计。当帧级特征向量来自卷积神经网络(CNN)时,我们对网络激活进行秩池化,并以端到端的方式联合估计模型的所有参数,包括CNN滤波器和全连接权重,我们称之为“端到端可训练的秩池化CNN”。重要的是,该模型可以使用任何现有的卷积神经网络架构(例如AlexNet或VGG),无需修改或引入额外参数。然后,我们将秩池化扩展为一种高容量的视频表示,称为“层次化秩池化”。层次化秩池化由一个秩池化函数网络组成,该网络基于丰富的帧级特征,对任意长视频片段中的时序语义进行编码。通过将非线性特征函数和时序子序列编码器层层堆叠,我们构建了一个对视频动态行为进行编码的高容量网络。生成的视频表示是一个描述整个视频片段的固定长度特征向量,可用作标准机器学习分类器的输入。我们在动作和活动识别任务上展示了我们的方法。在三个重要的活动识别基准上,获得的结果与最先进方法相当,分类性能在Hollywood2上达到76.7% mAP,在HMDB51上达到69.4%,在UCF101上达到93.6%。
引用
@article{arxiv.1705.10420,
title = {Discriminatively Learned Hierarchical Rank Pooling Networks},
author = {Basura Fernando and Stephen Gould},
journal= {arXiv preprint arXiv:1705.10420},
year = {2017}
}
备注
International Journal of Computer Vision