中文

面向电影理解的分层自监督表示学习

计算机视觉与模式识别 2022-04-08 v1

摘要

大多数自监督视频表示学习方法聚焦于动作识别。相比之下,本文关注面向电影理解的自监督视频学习,并提出一种新颖的分层自监督预训练策略,对我们分层电影理解模型的每一层分别进行预训练(基于[37])。具体而言,我们提出使用对比学习目标预训练底层视频骨干网络,同时使用事件掩码预测任务预训练高层视频上下文编码器,这使得可利用不同数据源预训练分层结构的不同层级。我们首先表明,我们的自监督预训练策略是有效的,并在 VidSitu 基准[37]上的所有任务与指标上带来性能提升(例如,将语义角色预测的 CIDEr 分数从47%提升至61%)。我们进一步展示了我们的上下文化事件特征在 LVU 任务[54]上的有效性,无论单独使用还是与实例特征结合使用均显示其互补性。

关键词

引用

@article{arxiv.2204.03101,
  title  = {Hierarchical Self-supervised Representation Learning for Movie Understanding},
  author = {Fanyi Xiao and Kaustav Kundu and Joseph Tighe and Davide Modolo},
  journal= {arXiv preprint arXiv:2204.03101},
  year   = {2022}
}

备注

CVPR 2022