面向电影理解的分层自监督表示学习
计算机视觉与模式识别
2022-04-08 v1
摘要
大多数自监督视频表示学习方法聚焦于动作识别。相比之下,本文关注面向电影理解的自监督视频学习,并提出一种新颖的分层自监督预训练策略,对我们分层电影理解模型的每一层分别进行预训练(基于[37])。具体而言,我们提出使用对比学习目标预训练底层视频骨干网络,同时使用事件掩码预测任务预训练高层视频上下文编码器,这使得可利用不同数据源预训练分层结构的不同层级。我们首先表明,我们的自监督预训练策略是有效的,并在 VidSitu 基准[37]上的所有任务与指标上带来性能提升(例如,将语义角色预测的 CIDEr 分数从47%提升至61%)。我们进一步展示了我们的上下文化事件特征在 LVU 任务[54]上的有效性,无论单独使用还是与实例特征结合使用均显示其互补性。
引用
@article{arxiv.2204.03101,
title = {Hierarchical Self-supervised Representation Learning for Movie Understanding},
author = {Fanyi Xiao and Kaustav Kundu and Joseph Tighe and Davide Modolo},
journal= {arXiv preprint arXiv:2204.03101},
year = {2022}
}
备注
CVPR 2022