中文

基于归一化流抑制静态视觉线索的自监督视频表征学习

计算机视觉与模式识别 2021-12-09 v2

摘要

尽管深度卷积神经网络在视频理解方面取得了巨大进展,但现有方法学习到的特征表征可能偏向于静态视觉线索。为解决此问题,我们提出了一种基于概率分析的抑制静态视觉线索(SSVC)新方法,用于自监督视频表征学习。在我们的方法中,视频帧首先通过归一化流编码为标准正态分布下的潜变量。通过将视频中的静态因素建模为随机变量,每个潜变量的条件分布变为平移和缩放的正态分布。然后,沿时间变化较小的潜变量被选为静态线索并被抑制,以生成保留运动的视频。最后,由保留运动的视频构建正样本对用于对比学习,以缓解表征对静态线索的偏差问题。偏差较小的视频表征能更好地泛化到各种下游任务。在公开基准上的大量实验表明,当仅使用单一 RGB 模态进行预训练时,所提方法优于最先进的(SOTA)方法。

关键词

引用

@article{arxiv.2112.03803,
  title  = {Suppressing Static Visual Cues via Normalizing Flows for Self-Supervised Video Representation Learning},
  author = {Manlin Zhang and Jinpeng Wang and Andy J. Ma},
  journal= {arXiv preprint arXiv:2112.03803},
  year   = {2021}
}

备注

AAAI2022. v2: Add supplementary