中文

基于迭代视觉提示的开放词汇动作定位

计算机视觉与模式识别 2025-04-08 v5 人工智能 机器人学

摘要

视频动作定位旨在从长视频中寻找特定动作的发生时间。尽管现有的基于学习的方法取得了成功,但它们需要对视频进行标注,这带来了相当大的人工成本。本文提出了一种基于新兴现成视觉-语言模型 (VLMs) 的免训练、开放词汇方法。挑战源于 VLM 既非为处理长视频而设计,也非为寻找动作而定制。我们通过扩展一种迭代视觉提示技术来克服这些问题。具体而言,我们对视频帧进行采样并创建一幅带有帧索引标签的拼接图像,使 VLM 能够识别最可能对应动作开始和结束的帧。通过在所选帧周围迭代地缩小采样窗口,估计逐渐收敛到更精确的时间边界。我们证明该技术产生了合理的性能,取得了与 SOTA 零样本动作定位相当的结果。这些结果支持将 VLM 作为理解视频的实用工具。示例代码可在 https://microsoft.github.io/VLM-Video-Action-Localization/ 获取。

关键词

引用

@article{arxiv.2408.17422,
  title  = {Open-Vocabulary Action Localization with Iterative Visual Prompting},
  author = {Naoki Wake and Atsushi Kanehira and Kazuhiro Sasabuchi and Jun Takamatsu and Katsushi Ikeuchi},
  journal= {arXiv preprint arXiv:2408.17422},
  year   = {2025}
}

备注

9 pages, 5 figures, 6 tables. Published in IEEE Access. Last updated on April 7th, 2025