GRAZE: 基于基础模型精炼与运动感知的零样本事件定位
计算机视觉与模式识别
2026-04-03 v1 人工智能
摘要
美式橄榄球训练会产生大量视频,但其中感兴趣的交互相应仅占据每个长而未剪辑片段中的短暂窗口。因此,可靠的生物力学分析依赖于时空定位,该定位需识别出交互实体以及接触的起始时刻。我们研究了在存在相机运动、杂乱背景、多名装备相似的运动员以及撞击前后姿态快速变化的非约束训练视频中的“首次接触点”(FPOC),定义为球员首次物理接触擒抱假人的帧。我们提出了GRAZE,一种无需训练的FPOC定位流程,且不需要任何带标签的擒抱接触示例。GRAZE使用Grounding DINO来发现候选的球员-假人交互,通过运动感知的时间推理对其进行精炼,并利用SAM2作为显式的像素级接触验证器,而非仅依赖检测置信度。这种候选发现与接触确认的分离使得该方法对杂乱场景和撞击附近不稳定的基础模型定位具有鲁棒性。在738个擒抱训练视频上,GRAZE对97.4%的片段生成了有效输出,并在77.5%的所有片段上将FPOC定位在±10帧以内,在82.7%的所有片段上定位在±20帧以内。这些结果表明,在无需特定任务训练的情况下,对真实训练视频进行帧精确的接触起始定位是可行的。
引用
@article{arxiv.2604.01383,
title = {GRAZE: Grounded Refinement and Motion-Aware Zero-Shot Event Localization},
author = {Syed Ahsan Masud Zaidi and Lior Shamir and William Hsu and Scott Dietrich and Talha Zaidi},
journal= {arXiv preprint arXiv:2604.01383},
year = {2026}
}
备注
9 pages, 5 figures, accepted to the CVPR 2026 Workshop on Computer Vision in Sports (CVSports) code: https://github.com/AhsanZaidi12/GRAZE