中文

Movies2Scenes:利用电影元数据学习场景表示

计算机视觉与模式识别 2023-03-31 v3

摘要

理解电影中的场景对于视频审核、搜索和推荐等多种应用至关重要。然而,标注单个场景是一个耗时的过程。相比之下,电影级元数据(如类型、梗概等)作为电影制作过程的一部分会定期产生,因此显著更常见。在本工作中,我们提出一种新颖的对比学习方法,利用电影元数据学习通用场景表示。具体而言,我们使用电影元数据定义电影相似度度量,并在对比学习期间将其用于将对正场景对的搜索限制为仅彼此被认为相似电影中的场景。我们学习的场景表示在利用多个基准数据集评估的多种任务上持续优于现有最先进方法。值得注意的是,在 LVU 数据集的七个分类任务上我们的表示平均提升 7.9%,在两个回归任务上提升 9.7%。此外,利用新收集的电影数据集,我们展示了我们的场景表示在一组视频审核任务上的对比结果,以证明其在先前较少探索任务上的泛化能力。

关键词

引用

@article{arxiv.2202.10650,
  title  = {Movies2Scenes: Using Movie Metadata to Learn Scene Representation},
  author = {Shixing Chen and Chun-Hao Liu and Xiang Hao and Xiaohan Nie and Maxim Arap and Raffay Hamid},
  journal= {arXiv preprint arXiv:2202.10650},
  year   = {2023}
}

备注

Accepted to CVPR 2023