中文

面向视频字幕的模型无关模块选择框架 MAMS

计算机视觉与模式识别 2025-10-09 v1 人工智能

摘要

多模态变换器正快速成为视频字幕任务中的关注焦点。现有的多模态视频字幕方法通常提取固定数量的帧,这带来了关键挑战。当提取的帧数量有限时,可能遗漏关键帧中包含的生成字幕所必需的重要信息。相反,提取过多的帧可能包含连续帧,导致从连续视频帧中提取的视觉标记之间产生冗余。为了为每个视频提取合适数量的帧,本文提出了首个面向视频字幕的模型无关模块选择框架,该框架具有两个主要功能:(1) 根据从视频帧中提取的视觉标记选择合适大小的字幕生成模块;(2) 为所选字幕生成模块构建视觉标记的子集。此外,我们提出了一种新的自适应注意力掩码方案,增强对重要视觉标记的注意力。我们在三个不同的基准数据集上的实验表明,所提出的框架显著提高了三个最近视频字幕模型的性能。

关键词

引用

@article{arxiv.2501.18269,
  title  = {MAMS: Model-Agnostic Module Selection Framework for Video Captioning},
  author = {Sangho Lee and Il Yong Chun and Hogun Park},
  journal= {arXiv preprint arXiv:2501.18269},
  year   = {2025}
}

备注

Accepted to the AAAI 2025 Main Technical Track. This is an extended version of the original submission