中文

用于自监督视频表示学习的跨模态流形 Cutmix

计算机视觉与模式识别 2023-07-31 v3

摘要

视频的对比表示学习高度依赖于数百万无标签视频的可用性。这对于网络上的视频是可行的,但为真实世界应用获取如此大规模的视频非常昂贵且费力。因此,本文聚焦于为自监督学习设计视频增强,我们首先分析了混合视频以创建新增强视频样本的最佳策略。随后问题在于,我们能否利用视频中的其他模态进行数据混合?为此,我们提出跨模态流形 Cutmix(CMMC),在特征空间中跨两种不同模态将一个视频超立方体插入另一个视频超立方体。我们发现,我们的视频混合策略 STC-mix,即先对视频进行初步混合,再跨视频中不同模态进行 CMMC,提升了所学视频表示的质量。我们在两个小规模视频数据集 UCF101 和 HMDB51 上针对动作识别与视频检索两个下游任务进行了充分实验。我们还展示了我们的 STC-mix 在领域知识有限的 NTU 数据集上的有效性。我们表明,我们的 STC-mix 在两个下游任务上的性能与其他自监督方法相当,同时需要更少的训练数据。

关键词

引用

@article{arxiv.2112.03906,
  title  = {Cross-modal Manifold Cutmix for Self-supervised Video Representation Learning},
  author = {Srijan Das and Michael S. Ryoo},
  journal= {arXiv preprint arXiv:2112.03906},
  year   = {2023}
}

备注

Accepted at MVA 2023