中文

通过对抗扰动进行对比式视频表征学习

计算机视觉与模式识别 2020-04-17 v3

摘要

对抗扰动是类似噪声的模式,能够微妙地改变数据,同时使原本准确的分类器失效。在本文中,我们提出在一种新颖的对比学习框架中利用此类扰动来构建负样本,进而用于生成改进的视频表征。为此,给定一个针对逐帧视频识别训练良好的深度模型,我们首先生成适配该模型的对抗噪声。正包与负包分别使用完整视频序列的原始数据特征及其扰动对应特征来生成。与经典对比学习方法不同,我们构建了一个二分类问题,学习一组判别超平面——作为一个子空间——将两类包彼此分离。该子空间随后被用作视频的描述子,称为判别子空间池化(discriminative subspace pooling)。由于扰动特征属于那些可能与原始特征相混淆的数据类别,该判别子空间将刻画特征空间中更具原始数据代表性的部分,从而可能提供鲁棒的 video 表征。为学习此类描述子,我们在 Stiefel 流形上形式化了一个子空间学习目标,并借助黎曼优化方法高效求解。我们在多个视频数据集上进行了实验,并展示了最先进的结果。

关键词

引用

@article{arxiv.1807.09380,
  title  = {Contrastive Video Representation Learning via Adversarial Perturbations},
  author = {Jue Wang and Anoop Cherian},
  journal= {arXiv preprint arXiv:1807.09380},
  year   = {2020}
}

备注

Revised version of ECCV 2018 Paper: Learning Discriminative Video Representations Using Adversarial Perturbations