中文

基于视觉-语言模型的教学视频多模态抽象式摘要

计算机视觉与模式识别 2026-05-13 v1 计算与语言

摘要

多模态视频摘要要求视觉特征在语义上与语言生成对齐。传统方法依赖于为物体分类训练的 CNN 特征,这些特征将视觉概念表示为与自然语言不对齐的离散类别。我们提出了 ClipSum,这是一个利用冻结的 CLIP 视觉-语言特征,并结合显式时间建模和维度自适应融合的框架,用于教学视频摘要。CLIP 在 4 亿图文对上的对比预训练产生了与文本解码器生成的语言概念在语义上对齐的视觉特征,从而在表征层面弥合了视觉-语言鸿沟。在 YouCook2 数据集上,ClipSum 的 ROUGE-1 得分达到 33.0%,而 ResNet-152 为 30.5%,且维度降低了 4 倍(512 对比 2048),这表明语义对齐比特征容量更重要。冻结的 CLIP(33.0%)超越了微调的 CLIP(32.3%),表明保留预训练对齐比任务特定适应更有价值。https://github.com/aqeeelmirza/clipsum

关键词

引用

@article{arxiv.2605.11959,
  title  = {Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models},
  author = {Maham Nazir and Muhammad Aqeel and Richong Zhang and Francesco Setti},
  journal= {arXiv preprint arXiv:2605.11959},
  year   = {2026}
}

备注

Accepted to ICPR 2026