SLIC:基于迭代聚类的自监督学习用于人体动作视频
计算机视觉与模式识别
2022-06-28 v1
摘要
自监督方法已显著缩小了图像分类中端到端监督学习的差距。然而,在人体动作视频中,由于外观和运动都是重要的变化因素,这一差距仍然显著。造成此现象的关键原因之一是,许多自监督对比学习方法所需的采样相似视频片段这一步,目前采取保守策略以避免假阳性。一个典型假设是相似片段仅出现在单个视频的时间邻近处,导致运动相似性的样本不足。为缓解该问题,我们提出 SLIC,一种基于聚类的自监督对比学习方法用于人体动作视频。我们的关键贡献在于,通过迭代聚类将相似视频实例分组,改进了传统的视频内正样本采样。这使得我们的方法能够利用聚类分配得到的伪标签来采样更难的 positives 和 negatives。SLIC 在 UCF101 上以 +15.4% 的 top-1 召回率优于最先进的视频检索基线,直接迁移到 HMDB51 时高出 +5.7%。通过端到端微调进行动作分类,SLIC 在 UCF101 上达到 83.2% 的 top-1 准确率(+0.8%),在 HMDB51 上达到 54.5%(+1.6%)。在 Kinetics400 上自监督预训练后,SLIC 在动作分类上也具最先进竞争力。
引用
@article{arxiv.2206.12534,
title = {SLIC: Self-Supervised Learning with Iterative Clustering for Human Action Videos},
author = {Salar Hosseini Khorasgani and Yuxuan Chen and Florian Shkurti},
journal= {arXiv preprint arXiv:2206.12534},
year = {2022}
}
备注
CVPR2022