中文

基于时间分组与空间定位的结构化视频-语言建模

计算机视觉与模式识别 2024-09-10 v3

摘要

现有的视频-语言预训练方法主要通过全局对比学习在视频片段与字幕之间进行实例级对齐,却忽视了视频和文本中丰富的细粒度局部信息,而这些信息对于需要时间定位与语义推理的下游任务至关重要。一个强大的模型应当能够捕捉区域-物体对应关系并识别视频片段中的场景变化,分别反映空间与时间粒度。为增强模型对此类细粒度细节的理解,我们提出了一个简洁而有效的视频-语言建模框架 S-ViLM,利用这两种模态的内在结构。它包含两项新颖设计:片段间空间定位与片段内时间分组,以同时促进区域-物体对齐与时间感知特征的学习。综合评估表明,S-ViLM 在学习更具表达力的表示方面优于现有方法。具体而言,S-ViLM 在四个代表性下游任务(涵盖文本-视频检索、视频问答、视频动作识别与时间动作定位)上大幅超越 SOTA 方法。

关键词

引用

@article{arxiv.2303.16341,
  title  = {Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding},
  author = {Yuanhao Xiong and Long Zhao and Boqing Gong and Ming-Hsuan Yang and Florian Schroff and Ting Liu and Cho-Jui Hsieh and Liangzhe Yuan},
  journal= {arXiv preprint arXiv:2303.16341},
  year   = {2024}
}

备注

Accepted to ICLR2024, see https://openreview.net/forum?id=5dlfiJIXoh for more details