MaCLR:面向视频表示的动作感知对比学习
计算机视觉与模式识别
2022-07-21 v2
摘要
我们提出 MaCLR,一种从视觉与运动模态显式执行跨模态自监督视频表示学习的新方法。与以往主要聚焦于从 RGB 输入中隐式学习运动线索的视频表示学习方法不同,MaCLR 通过运动通路与视觉通路之间的跨模态学习目标,丰富了 RGB 视频片段的标准对比学习目标。我们表明,使用我们的 MaCLR 方法学习到的表示更关注前景运动区域,从而能更好地泛化到下游任务。为证明这一点,我们在五个数据集上评估 MaCLR 的动作识别与动作检测任务,并在所有数据集上展示了最先进的自监督性能。此外,我们表明 MaCLR 表示在 UCF101 和 HMDB51 动作识别上可与全监督学习的表示同样有效,甚至在 VidSitu 和 SSv2 的动作识别以及 AVA 的动作检测上优于监督表示。
引用
@article{arxiv.2106.09703,
title = {MaCLR: Motion-aware Contrastive Learning of Representations for Videos},
author = {Fanyi Xiao and Joseph Tighe and Davide Modolo},
journal= {arXiv preprint arXiv:2106.09703},
year = {2022}
}
备注
ECCV 2022