中文

ActPrompt:基于动作线索的视频时间 grounding 域内特征适应方法

计算机视觉与模式识别 2024-08-14 v1

摘要

视频时间 grounding 是一个旨在识别视频中特定片段的新兴主题。除了预训练视频模型外,当前方法还利用预训练视觉语言模型(VLM)来捕捉来自视频帧中多样化场景和物体的细节特征。然而,由于 VLM 是在图像上预训练的,可能难以区分动作敏感模式与静态物体,因此需要为有效的时间 grounding 特征表示而将其适应到特定数据域。为实现此目标,我们提出两种主要挑战的解决方案。具体而言,为缓解高适应成本,我们提出了一种高效的最初域内微调范例,用于特征适应,through several pretext tasks 学习 downstream-adaptive features。Furthermore, 为将动作敏感信息整合到 VLM,我们引入了基于动作线索的时间提示学习(ActPrompt),将动作线索注入 VLM 的图像编码器,以更好地发现动作敏感模式。大量实验表明,ActPrompt 是一个可有效应用于 various SOTA methods 的开箱即用训练框架,结果显著改善。本研究使用的完整代码已提供于补充材料中。

关键词

引用

@article{arxiv.2408.06622,
  title  = {ActPrompt: In-Domain Feature Adaptation via Action Cues for Video Temporal Grounding},
  author = {Yubin Wang and Xinyang Jiang and De Cheng and Dongsheng Li and Cairong Zhao},
  journal= {arXiv preprint arXiv:2408.06622},
  year   = {2024}
}

备注

9 pages, 5 figures