中文

Scene-VLM:基于视觉语言模型的多模态视频场景分割

计算机视觉与模式识别 2026-03-24 v2

摘要

将长视频分割成语义连贯的场景是大规模视频理解中的一项基础任务。现有的基于编码器的方法受限于以视觉为中心的偏差,孤立地对每个镜头进行分类而未利用序列依赖性,并且缺乏叙事理解和可解释性。在本文中,我们提出了 Scene-VLM,这是首个用于视频场景分割的微调视觉语言模型 (VLM) 框架。Scene-VLM 联合处理包括帧、转录和可选元数据在内的视觉和文本线索,以实现跨连续镜头的多模态推理。该模型按顺序生成预测,在镜头间具有因果依赖性,并引入了上下文聚焦窗口机制以确保每个镜头级决策具有足够的时间上下文。此外,我们提出了一种从 VLM 的 token 级 logits 中提取置信度分数的方案,实现了以前仅限于基于编码器方法的可控精确率-召回率权衡。进一步地,我们证明了通过最少的目标监督,我们的模型可以对齐生成连贯的自然语言理由来解释其边界决策。我们的方法在标准场景分割基准上取得了 SOTA 性能。例如,在 MovieNet 上,Scene-VLM 较之前领先方法取得了 +6 AP 和 +13.7 F1 的显著提升。

关键词

引用

@article{arxiv.2512.21778,
  title  = {Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models},
  author = {Nimrod Berman and Adam Botach and Emanuel Ben-Baruch and Shunit Haviv Hakimi and Asaf Gendler and Ilan Naiman and Erez Yosef and Igor Kviatkovsky},
  journal= {arXiv preprint arXiv:2512.21778},
  year   = {2026}
}

备注

Accepted for publication at CVPR 2026