基于启发式解耦视角的自监督视频表征学习
计算机视觉与模式识别
2026-02-09 v2
摘要
视频对比学习(V-CL)已成为无监督视频表征学习的热门框架,在动作分类和检测等任务中显示出强大的性能。然而,要充分发挥这些好处,学习到的表征必须完全捕获静态语义和动态语义。我们的实验表明,现有的 V-CL 方法未能有效学习这两种类型的元素。通过基于结构因果模型和梯度更新的严格理论分析,我们发现,在给定数据集中,某些静态语义持续地与特定的动态语义共现。这一现象在数据集中的静态语义和动态语义之间创建了虚假的相关性。然而,现有的 V-CL 方法在计算样本相似性时不区分静态和动态相似性。结果是,仅学习一种类型的语义就足以最小化对比损失。最终,这会导致 V-CL 预训练过程优先学习更容易学习的语义。为了解决这一局限性,我们提出了用于视频对比学习的双层优化与解耦(BOD-VCL)。在 BOD-VCL 中,我们基于 Koopman 理论将视频建模为线性动力学系统。在该系统中,所有帧间转换都由线性 Koopman 算子表示。通过对该算子进行特征分解,我们可以分离时间可变和时间不变语义的组成部分,这允许我们在视频中显式地分离静态和动态语义。通过单独建模静态和动态相似性,可以在 V-CL 训练过程中充分利用这两种语义。BOD-VCL 可以无缝集成到现有的 V-CL 框架中,实验结果突显了我们方法带来的显著改进。
关键词
引用
@article{arxiv.2407.14069,
title = {Self-Supervised Video Representation Learning in a Heuristic Decoupled Perspective},
author = {Zeen Song and Wenwen Qiang and Changwen Zheng and Hui Xiong and Gang Hua},
journal= {arXiv preprint arXiv:2407.14069},
year = {2026}
}