中文

VideoGEM:基于预训练图像-视频语言模型的无训练动作 grounding 方法

计算机视觉与模式识别 2025-03-27 v1 人工智能 计算与语言 机器学习

摘要

视觉语言基础模型在各类零样例任务中展现出惊人的能力,包括主要聚焦于图像中局部化和grounding的无训练局部化技术。然而,利用这些技术来局部化视频中的动作和事件具有挑战性,因为动作缺乏明确的物理轮廓,通常由更高层次的概念描述。本文提出VideoGEM,这是首个基于预训练图像-和视频语言 backbone 的无训练空间动作grounding方法。我们将GEM的自-自注意力公式适用于空间活动grounding。我们观察到,诸如动作等高层次语义概念通常在图像-和视频语言模型的高层中出现。因此,我们提出在自注意力路径中引入层级加权,以优先考虑高层。此外,我们引入动态加权方法,以自动调整层级权重以捕获特定提示的相关性。最后,我们引入提示分解,分别处理动作、动词和客体提示,从而实现对动作的更好空间局部化。我们在CLIPS、OpenCLIP和ViCLIP三种图像-和视频语言 backbone 上进行评估,并在V-HICO、DALY、YouCook-Interactions和GroundingYouTube四个视频grounding数据集上测试,表明所提出的无训练方法能够超越当前用于空间视频grounding的训练型最先进方法。

关键词

引用

@article{arxiv.2503.20348,
  title  = {VideoGEM: Training-free Action Grounding in Videos},
  author = {Felix Vogel and Walid Bousselham and Anna Kukleva and Nina Shvetsova and Hilde Kuehne},
  journal= {arXiv preprint arXiv:2503.20348},
  year   = {2025}
}