不再有捷径:释放时序自监督的潜力
计算机视觉与模式识别
2023-12-21 v1 人工智能
机器学习
摘要
针对视频的自监督方法在视频理解任务中展现了令人瞩目的结果。然而,不同于利用时序自监督的早期工作,当前最先进的方法主要依赖于图像域的任务(例如,对比学习),这些任务并未显式促进时序特征的学习。我们指出了限制现有自监督时序学习的两个因素:1)任务过于简单,导致训练性能饱和;2)我们发现了基于局部外观统计的捷径,其阻碍了高层特征的学习。为了解决这些问题,我们提出:1)将时序自监督重新表述为更具挑战性的帧级(而非片段级)识别任务;2)一种有效的数据增强策略以缓解捷径问题。我们的模型通过时序自监督训练一个 Transformer,扩展了通过对比学习预训练的单帧视频表示。我们通过实验证明,更具挑战性的帧级任务表述以及捷径的消除,极大地提升了通过时序自监督学习到的特征质量。我们提出的自监督视频方法的泛化能力,体现在其在包括视频检索、动作分类和视频属性识别(如物体和场景识别),以及诸如视频目标分割和姿态跟踪等低级时序对应任务等广泛的语义任务上的最先进性能。此外,我们表明通过我们方法学习到的视频表示对输入扰动表现出更强的鲁棒性。
引用
@article{arxiv.2312.13008,
title = {No More Shortcuts: Realizing the Potential of Temporal Self-Supervision},
author = {Ishan Rajendrakumar Dave and Simon Jenni and Mubarak Shah},
journal= {arXiv preprint arXiv:2312.13008},
year = {2023}
}
备注
AAAI 2024 (Main Technical Track)