用于场景边界检测的镜头对比自监督学习
计算机视觉与模式识别
2021-04-29 v1
摘要
场景在将电影和电视剧的故事线划分为语义连贯的片段方面起着关键作用。然而,鉴于其复杂的时间结构,寻找场景边界可能是一项具有挑战性的任务,需要大量标注训练数据。为应对这一挑战,我们提出一种自监督镜头对比学习方法(ShotCoL),以学习一种镜头表示,使相邻镜头之间的相似度相对于随机选取的镜头最大化。我们展示了如何将所学镜头表示应用于场景边界检测任务,在 MovieNet 数据集上以仅约 25% 的训练标签、少 9 倍的模型参数和快 7 倍的运行时间实现了 state-of-the-art 性能。为评估 ShotCoL 在场景边界检测新应用上的有效性,我们着手解决在电影和电视剧中寻找可插入视频广告且观看体验干扰最小的时间戳问题。为此,我们收集了一个名为 AdCuepoints 的新数据集,包含 3,975 部电影和电视剧、220 万镜头和 19,119 个最小干扰广告插入点标签。我们对该数据集进行了详尽的实证分析,证明了 ShotCoL 在广告插入点检测上的有效性。
引用
@article{arxiv.2104.13537,
title = {Shot Contrastive Self-Supervised Learning for Scene Boundary Detection},
author = {Shixing Chen and Xiaohan Nie and David Fan and Dongqing Zhang and Vimal Bhat and Raffay Hamid},
journal= {arXiv preprint arXiv:2104.13537},
year = {2021}
}
备注
Accepted to CVPR 2021