一种多模态电影场景分割的局部到全局方法
计算机视觉与模式识别
2020-04-29 v3 多媒体
摘要
场景作为电影中叙事的关键单元,包含演员在物理环境中的复杂活动及其交互。识别场景的构成是迈向电影语义理解的关键一步。这极具挑战性——与常规视觉问题(例如动作识别)中研究的视频相比,电影中的场景通常包含更丰富的时间结构和更复杂的语义信息。为实现这一目标,我们通过构建大规模视频数据集 MovieScenes 扩展了场景分割任务,该数据集包含来自 150 部电影的 21K 个标注场景片段。我们进一步提出了一种局部到全局的场景分割框架,该框架在片段、段和电影三个层级上融合多模态信息。该框架能够从长电影的分层时间结构中提炼复杂语义,为场景分割提供自顶向下的指导。我们的实验表明,所提出的网络能够高精度地将电影分割为场景,持续优于先前的方法。我们还发现,在我们的 MovieScenes 上进行预训练可以为现有方法带来显著提升。
引用
@article{arxiv.2004.02678,
title = {A Local-to-Global Approach to Multi-modal Movie Scene Segmentation},
author = {Anyi Rao and Linning Xu and Yu Xiong and Guodong Xu and Qingqiu Huang and Bolei Zhou and Dahua Lin},
journal= {arXiv preprint arXiv:2004.02678},
year = {2020}
}
备注
CVPR2020. Project page: https://anyirao.com/projects/SceneSeg.html