中文

基于大型视觉语言模型置信度的零样态动作定位

计算机视觉与模式识别 2025-03-26 v2

摘要

在无剪辑视频中进行精确的动作定位对于专业体育和 minimally invasive 手术等领域至关重要,因为对录制中特定运动的描绘可以显著增强分析效果。但在许多情况下,缺乏大规模的带有视频-标签对的本地化数据集,限制了对视频理解模型进行微调的机会。最近的大型视觉语言模型 (LVLM) 通过在各种视频理解任务中展现出惊人的零样能力,解决了这一需求。然而,将 LVLM 那强大的视觉问答能力应用于长视频的零样本地化仍相对未被充分探索。为了此目的,我们提出一种真正的零样态动作本地化方法(ZEAL)。具体而言,我们利用大型语言模型 (LLM) 中内置的动作知识,将动作膨胀为对典型动作开始和结束的详细描述。这些描述作为查询信号被输入 LVLM,以生成帧级置信度得分,这些得分可以被聚合以产生本地化输出。我们方法的简单性和灵活性使其能够适应更强大的 LVLM 的发展,我们在一个具有挑战性的基准测试上展示了零样态动作本地化的惊人结果,无需任何训练。我们的代码已公开于 \href\href{https://github.com/josaklil-ai/zeal}{github.com/josaklil-ai/zeal}

关键词

引用

@article{arxiv.2410.14340,
  title  = {Zero-shot Action Localization via the Confidence of Large Vision-Language Models},
  author = {Josiah Aklilu and Xiaohan Wang and Serena Yeung-Levy},
  journal= {arXiv preprint arXiv:2410.14340},
  year   = {2025}
}