中文

EVE:基于视觉语言模型的端到端视频字幕提取

计算机视觉与模式识别 2025-12-05 v2

摘要

视频字幕在短视频和电影中起着关键作用,不仅有助于模型更好地理解视频内容,还支持视频翻译和内容检索等应用。现有的视频字幕提取方法通常依赖多阶段框架,跨阶段误差累积,且由于逐帧处理,未充分利用时序依赖性。此外,尽管某些大型视觉语言模型 (LVLMs) 具备强大的 OCR 能力,但准确预测字幕文本的时间戳仍具有挑战性。为此,我们提出了一个基于 LVLMs 的端到端视频字幕提取框架,命名为 EVE,可同时输出字幕及其时间戳。具体而言,我们引入双分支时空字幕显著模块 (S\textsuperscript{3}) 作为 LVLMs 的适配器,能够表示字幕相关内容,并仅通过少量 token 考虑帧间关联性。在该模块中,空间语义上下文聚合分支聚合高层全局语义,以提供空间视觉上下文信息;而时间字幕 token 查询分支则显式查询字幕相关 token,并考虑跨帧的时间关联。S\textsuperscript{3} 模块保留的少量 token 被输入语言模型,从而直接输出字幕文本及其时间戳。此外,我们构建了首个专为视频字幕提取设计的大规模数据集 V\textsuperscript{i}S,包含超过 250 万个带时间戳和双语标注的视频,为社区提供了组织良好的训练和评估基准。

引用

@article{arxiv.2503.04058,
  title  = {EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models},
  author = {Haiyang Yu and Mengyang Zhao and Jinghui Lu and Ke Niu and Yanjie Wang and Weijie Yin and Weitao Jia and Teng Fu and Yang Liu and Jun Liu and Hong Chen},
  journal= {arXiv preprint arXiv:2503.04058},
  year   = {2025}
}