GOCA:用于自监督视频表征学习的引导式在线聚类分配
计算机视觉与模式识别
2022-07-22 v1
摘要
聚类是无监督学习中普遍使用的工具。大多数现有的自监督表征学习方法通常基于视觉主导特征对样本聚类。虽然这对于基于图像的自监督有效,但对于需要理解运动而非关注背景的视频往往失效。使用光流作为对 RGB 的补充信息可以缓解此问题。然而,我们观察到两种视图的朴素组合并不能提供有意义的增益。在本文中,我们提出了一种结合两种视图的原则性方法。具体而言,我们提出了一种新颖的聚类策略,其中将每种视图的初始聚类分配作为先验来引导另一视图的最终聚类分配。该思路将强制两种视图具有相似的聚类结构,且所形成的聚类在语义上抽象并对来自各个视图的噪声输入具有鲁棒性。此外,我们提出了一种新颖的正则化策略来解决基于聚类的自监督学习方法中常见的特征崩溃问题。我们广泛的评估显示了所学表征在下游任务(例如视频检索和动作识别)上的有效性。具体而言,我们在 UCF 上以 7% 和 HMDB 上以 4% 的优势超越视频检索的 SOTA,并在 UCF 上以 5% 和 HMDB 上以 6% 的优势超越视频分类的 SOTA。
引用
@article{arxiv.2207.10158,
title = {GOCA: Guided Online Cluster Assignment for Self-Supervised Video Representation Learning},
author = {Huseyin Coskun and Alireza Zareian and Joshua L. Moore and Federico Tombari and Chen Wang},
journal= {arXiv preprint arXiv:2207.10158},
year = {2022}
}
备注
Accepted by ECCV 2022