揭示分布偏移下视频自监督学习的隐藏动态
计算机视觉与模式识别
2023-10-31 v2 机器学习
摘要
视频自监督学习(VSSL)近年来取得显著进展。然而,这些模型在不同形式分布偏移下的确切行为与动态尚属未知。本文全面研究了六种流行自监督方法(v-SimCLR、v-MoCo、v-BYOL、v-SimSiam、v-DINO、v-MAE)对各种自然分布偏移的响应,即(i)上下文偏移、(ii)视角偏移、(iii)主体偏移、(iv)源偏移、(v)对未知类的泛化能力(零样本)以及(vi)开集识别。为开展此项广泛研究,我们利用可用公共数据集精心构建了一个由 17 个分布内与分布外基准对组成的测试平台,并设计一系列评估协议以在预期偏移下对各类方法进行压力测试。我们的研究揭示了一系列引人入胜的发现与 VSSL 方法的有趣行为。例如,我们观察到尽管视频模型普遍受困于上下文偏移,v-MAE 与有监督学习表现出更强鲁棒性。此外,我们的研究表明 v-MAE 是强时序学习器,而对比方法 v-SimCLR 与 v-MoCo 在对抗视角偏移时表现优异。在考察开集识别概念时,我们注意到若预训练的 VSSL 编码器未经微调便使用,闭集与开集识别性能间存在权衡。我们希望我们的工作有助于为各种真实场景开发鲁棒的视频表征学习框架。项目页面与代码见:https://pritamqu.github.io/OOD-VSSL。
引用
@article{arxiv.2306.02014,
title = {Uncovering the Hidden Dynamics of Video Self-supervised Learning under Distribution Shifts},
author = {Pritam Sarkar and Ahmad Beirami and Ali Etemad},
journal= {arXiv preprint arXiv:2306.02014},
year = {2023}
}
备注
NeurIPS 2023 Spotlight