ActPrompt:基于动作线索的视频时间 grounding 域内特征适应方法
计算机视觉与模式识别
2024-08-14 v1
摘要
视频时间 grounding 是一个旨在识别视频中特定片段的新兴主题。除了预训练视频模型外,当前方法还利用预训练视觉语言模型(VLM)来捕捉来自视频帧中多样化场景和物体的细节特征。然而,由于 VLM 是在图像上预训练的,可能难以区分动作敏感模式与静态物体,因此需要为有效的时间 grounding 特征表示而将其适应到特定数据域。为实现此目标,我们提出两种主要挑战的解决方案。具体而言,为缓解高适应成本,我们提出了一种高效的最初域内微调范例,用于特征适应,through several pretext tasks 学习 downstream-adaptive features。Furthermore, 为将动作敏感信息整合到 VLM,我们引入了基于动作线索的时间提示学习(ActPrompt),将动作线索注入 VLM 的图像编码器,以更好地发现动作敏感模式。大量实验表明,ActPrompt 是一个可有效应用于 various SOTA methods 的开箱即用训练框架,结果显著改善。本研究使用的完整代码已提供于补充材料中。
引用
@article{arxiv.2408.06622,
title = {ActPrompt: In-Domain Feature Adaptation via Action Cues for Video Temporal Grounding},
author = {Yubin Wang and Xinyang Jiang and De Cheng and Dongsheng Li and Cairong Zhao},
journal= {arXiv preprint arXiv:2408.06622},
year = {2024}
}
备注
9 pages, 5 figures