中文

Global2Local:一种用于视频字幕生成的联合层次化注意力

计算机视觉与模式识别 2025-04-15 v2

摘要

近年来,自动视频字幕生成引起了越来越多的关注,其核心挑战在于从冗余的帧和语义内容中捕获关键语义项(如物体和动作)及其时空关联。为此,现有工作要么在全局层面(跨多帧)选择关键视频片段,要么选择每帧内的关键区域,然而这忽略了层次顺序,即先关键帧后关键区域。在本文中,我们提出了一种新颖的用于视频字幕生成的联合层次化注意力模型,该模型以层次化方式将关键片段、关键帧和关键区域联合嵌入到字幕模型中。这种联合层次化注意力模型首先进行全局选择以识别关键帧,随后通过 Gumbel 采样操作基于关键帧进一步识别关键区域,从而实现准确的从全局到局部的特征表示以引导字幕生成。在两个公开基准数据集 MSVD 和 MSR-VTT 上的大量定量评估证明了所提方法相对于最先进方法的优越性。

关键词

引用

@article{arxiv.2203.06663,
  title  = {Global2Local: A Joint-Hierarchical Attention for Video Captioning},
  author = {Chengpeng Dai and Fuhai Chen and Xiaoshuai Sun and Rongrong Ji and Qixiang Ye and Yongjian Wu},
  journal= {arXiv preprint arXiv:2203.06663},
  year   = {2025}
}

备注

The experiments and the comparisons are out of date. We will advance the framework and the algorithms with large changes