中文

TransRank:基于排序变换识别的自监督视频表示学习

计算机视觉与模式识别 2022-05-05 v1

摘要

识别应用于视频片段的变换类型(RecogTrans)是一种确立已久的自监督视频表示学习范式,在近期工作中其性能远逊于实例判别方法(InstDisc)。然而,基于对代表性 RecogTrans 与 InstDisc 方法的透彻比较,我们观察到 RecogTrans 在语义相关与时序相关下游任务上的巨大潜力。基于硬标签分类,现有 RecogTrans 方法在预训练中受困于含噪监督信号。为缓解该问题,我们提出了 TransRank,一种以排序形式识别变换的统一框架。TransRank 通过相对地识别变换提供准确监督信号,一致地优于基于分类的形式。同时,该统一框架可用任意时序或空间变换集合实例化,展现出良好通用性。借助基于排序的形式与若干经验实践,我们在视频检索与动作识别上取得具竞争力性能。在相同设定下,TransRank 在 UCF101 与 HMDB51 的动作识别(Top1 准确率)上分别超越先前 SOTA 方法 6.4% 与 8.3%;在 UCF101 视频检索上提升 20.4%(R@1)。这些可喜结果验证了 RecogTrans 仍是值得探索的视频自监督学习范式。代码将发布于 https://github.com/kennymckormick/TransRank。

关键词

引用

@article{arxiv.2205.02028,
  title  = {TransRank: Self-supervised Video Representation Learning via Ranking-based Transformation Recognition},
  author = {Haodong Duan and Nanxuan Zhao and Kai Chen and Dahua Lin},
  journal= {arXiv preprint arXiv:2205.02028},
  year   = {2022}
}

备注

CVPR 2022 Oral