中文

OS-MSL:面向场景分割与分类的单阶段多模态序列链接框架

计算机视觉与模式识别 2022-07-05 v1

摘要

场景分割与分类(SSC)是视频结构化分析领域的关键步骤。直观上,联合学习这两个任务可通过共享公共信息相互促进。然而,场景分割更关注相邻镜头之间的局部差异,而分类需要场景片段的全局表示,这可能导致模型在训练阶段被其中一项任务主导。本文从克服上述挑战的另一种视角出发,通过将镜头链接预测这一新形式统一两项任务:一条链接连接两个相邻镜头,表明它们属于同一场景或类别。为此,我们提出一种通用的单阶段多模态序列链接框架(OS-MSL),通过将两个学习任务重构为统一任务,来区分并利用这两重语义。此外,我们定制了一个名为 DiffCorrNet 的特定模块,以显式提取镜头间差异与关联的信息。我们在从真实应用中收集的全新大规模数据集以及 MovieScenes 上进行了大量实验,结果均证明了所提方法相对于强基线的有效性。

关键词

引用

@article{arxiv.2207.01241,
  title  = {OS-MSL: One Stage Multimodal Sequential Link Framework for Scene Segmentation and Classification},
  author = {Ye Liu and Lingfeng Qiao and Di Yin and Zhuoxuan Jiang and Xinghua Jiang and Deqiang Jiang and Bo Ren},
  journal= {arXiv preprint arXiv:2207.01241},
  year   = {2022}
}

备注

Accepted by ACM MM 2022