基于时空立方体拼图的自监督视频表征学习
计算机视觉与模式识别
2018-11-27 v1
摘要
在标记图像数量有限或完全缺失时,着色、修复和拼图等自监督任务已被用于静态图像的视觉表征学习。近来,这一有价值的研流扩展到视频领域,其中人工标注的成本甚至更为昂贵。然而,现有大多数方法仍基于无法直接捕获视频应用时空信息的 2D CNN 架构。本文中,我们引入了一种称为时空立方体拼图(Space-Time Cubic Puzzles)的新自监督任务,以使用大规模视频数据集训练 3D CNN。该任务要求网络排列被置换的 3D 时空块。通过完成时空立方体拼图,网络学习视频帧的空间外观与 temporal 关系,这正是我们的最终目标。在实验中,我们证明了所学得的 3D 表征能很好地迁移到动作识别任务,并在 UCF101 和 HMDB51 数据集上优于最先进的基于 2D CNN 的竞争对手。
引用
@article{arxiv.1811.09795,
title = {Self-Supervised Video Representation Learning with Space-Time Cubic Puzzles},
author = {Dahun Kim and Donghyeon Cho and In So Kweon},
journal= {arXiv preprint arXiv:1811.09795},
year = {2018}
}
备注
Accepted to AAAI 2019