视频 Transformer 的长短时对比学习
计算机视觉与模式识别
2022-04-01 v3 人工智能
摘要
视频 Transformer 近来已成为 3D CNN 用于视频理解的竞争性替代方案。然而,由于其大量参数与弱化的归纳偏置,这些模型需在大规模图像数据集上监督预训练方能取得顶尖性能。本文通过实证表明,仅在视频数据集上自监督预训练视频 Transformer 可取得与大规模图像数据集(即便如 ImageNet-21K 般海量)监督预训练相当或更优的动作识别结果。由于基于 Transformer 的模型善于捕捉长时程依赖,我们提出一种简单学习过程,迫使模型将同一视频的长时视图与短时视图相匹配。我们的方法名为长短期对比学习(LSTCL),使视频 Transformer 能通过预测从更长时域捕获的时间上下文来学习有效的片段级表示。为证明发现的通用性,我们在三种不同自监督对比学习框架(MoCo v3、BYOL、SimSiam)下采用两种不同视频 Transformer 架构(含一种增强时空注意力的改进 Swin Transformer 变体)实现并验证本方法。我们进行了详尽消融研究,并显示 LSTCL 在多个视频基准上取得竞争性性能,代表了有说服力的监督图像预训练替代方案。
引用
@article{arxiv.2106.09212,
title = {Long-Short Temporal Contrastive Learning of Video Transformers},
author = {Jue Wang and Gedas Bertasius and Du Tran and Lorenzo Torresani},
journal= {arXiv preprint arXiv:2106.09212},
year = {2022}
}
备注
Accepted in CVPR 2022