中文

SLIC:基于迭代聚类的自监督学习用于人体动作视频

计算机视觉与模式识别 2022-06-28 v1

摘要

自监督方法已显著缩小了图像分类中端到端监督学习的差距。然而,在人体动作视频中,由于外观和运动都是重要的变化因素,这一差距仍然显著。造成此现象的关键原因之一是,许多自监督对比学习方法所需的采样相似视频片段这一步,目前采取保守策略以避免假阳性。一个典型假设是相似片段仅出现在单个视频的时间邻近处,导致运动相似性的样本不足。为缓解该问题,我们提出 SLIC,一种基于聚类的自监督对比学习方法用于人体动作视频。我们的关键贡献在于,通过迭代聚类将相似视频实例分组,改进了传统的视频内正样本采样。这使得我们的方法能够利用聚类分配得到的伪标签来采样更难的 positives 和 negatives。SLIC 在 UCF101 上以 +15.4% 的 top-1 召回率优于最先进的视频检索基线,直接迁移到 HMDB51 时高出 +5.7%。通过端到端微调进行动作分类,SLIC 在 UCF101 上达到 83.2% 的 top-1 准确率(+0.8%),在 HMDB51 上达到 54.5%(+1.6%)。在 Kinetics400 上自监督预训练后,SLIC 在动作分类上也具最先进竞争力。

关键词

引用

@article{arxiv.2206.12534,
  title  = {SLIC: Self-Supervised Learning with Iterative Clustering for Human Action Videos},
  author = {Salar Hosseini Khorasgani and Yuxuan Chen and Florian Shkurti},
  journal= {arXiv preprint arXiv:2206.12534},
  year   = {2022}
}

备注

CVPR2022