基于迭代视觉提示的开放词汇动作定位
计算机视觉与模式识别
2025-04-08 v5 人工智能
机器人学
摘要
视频动作定位旨在从长视频中寻找特定动作的发生时间。尽管现有的基于学习的方法取得了成功,但它们需要对视频进行标注,这带来了相当大的人工成本。本文提出了一种基于新兴现成视觉-语言模型 (VLMs) 的免训练、开放词汇方法。挑战源于 VLM 既非为处理长视频而设计,也非为寻找动作而定制。我们通过扩展一种迭代视觉提示技术来克服这些问题。具体而言,我们对视频帧进行采样并创建一幅带有帧索引标签的拼接图像,使 VLM 能够识别最可能对应动作开始和结束的帧。通过在所选帧周围迭代地缩小采样窗口,估计逐渐收敛到更精确的时间边界。我们证明该技术产生了合理的性能,取得了与 SOTA 零样本动作定位相当的结果。这些结果支持将 VLM 作为理解视频的实用工具。示例代码可在 https://microsoft.github.io/VLM-Video-Action-Localization/ 获取。
引用
@article{arxiv.2408.17422,
title = {Open-Vocabulary Action Localization with Iterative Visual Prompting},
author = {Naoki Wake and Atsushi Kanehira and Kazuhiro Sasabuchi and Jun Takamatsu and Katsushi Ikeuchi},
journal= {arXiv preprint arXiv:2408.17422},
year = {2025}
}
备注
9 pages, 5 figures, 6 tables. Published in IEEE Access. Last updated on April 7th, 2025