中文

基于时空立方体拼图的自监督视频表征学习

计算机视觉与模式识别 2018-11-27 v1

摘要

在标记图像数量有限或完全缺失时,着色、修复和拼图等自监督任务已被用于静态图像的视觉表征学习。近来,这一有价值的研流扩展到视频领域,其中人工标注的成本甚至更为昂贵。然而,现有大多数方法仍基于无法直接捕获视频应用时空信息的 2D CNN 架构。本文中,我们引入了一种称为时空立方体拼图(Space-Time Cubic Puzzles)的新自监督任务,以使用大规模视频数据集训练 3D CNN。该任务要求网络排列被置换的 3D 时空块。通过完成时空立方体拼图,网络学习视频帧的空间外观与 temporal 关系,这正是我们的最终目标。在实验中,我们证明了所学得的 3D 表征能很好地迁移到动作识别任务,并在 UCF101 和 HMDB51 数据集上优于最先进的基于 2D CNN 的竞争对手。

关键词

引用

@article{arxiv.1811.09795,
  title  = {Self-Supervised Video Representation Learning with Space-Time Cubic Puzzles},
  author = {Dahun Kim and Donghyeon Cho and In So Kweon},
  journal= {arXiv preprint arXiv:1811.09795},
  year   = {2018}
}

备注

Accepted to AAAI 2019