用于视频表示学习的时空裁剪聚合
计算机视觉与模式识别
2023-03-14 v2
摘要
我们提出用于视频表示学习的时空裁剪聚合(SCALE),一种在训练与推理时均具有高可扩展性的新方法。我们的模型通过从预训练骨干网络提取的一组视频片段级特征中学习来构建长程视频特征。为训练该模型,我们提出了一个由掩码片段特征预测组成的自监督目标。我们对输入施加稀疏性(通过提取随机的一组视频片段),并对损失函数施加稀疏性(仅重构稀疏输入)。此外,我们通过在应用于单个视频片段的预训练骨干网络的潜空间上工作来进行降维。这些技术使我们的方法不仅训练极其高效,而且在迁移学习中高度有效。我们证明了我们的视频表示在常见动作分类与视频理解数据集上通过线性、非线性和 KNN 探测取得了最先进的性能。
引用
@article{arxiv.2211.17042,
title = {Spatio-Temporal Crop Aggregation for Video Representation Learning},
author = {Sepehr Sameni and Simon Jenni and Paolo Favaro},
journal= {arXiv preprint arXiv:2211.17042},
year = {2023}
}