RELOCATE:基于区域表示的视觉查询定位无训练基线
计算机视觉与模式识别
2025-12-11 v2
摘要
我们提出RELOCATE,这是一个为在长视频中执行挑性视觉查询定位任务而设计的简单无训练基线。为消除任务特定训练的需求并高效处理长视频,RELOCATE利用来自预训练视觉模型派生的区域表示。总体而言,它遵循经典对象定位方法:(1)识别每个视频帧中的所有对象,(2)将对象与给定查询进行比较并选择最相似的对象,(3)执行双向跟踪以获得时空响应。然而,我们对处理小目标、杂乱场景、部分可见性以及变化外观提出了若干关键改进。值得注意的是,我们对选定对象进行细化以实现精确定位,并生成额外的视觉查询以捕捉视觉变化。我们在具有挑性的Ego4D视觉查询2D定位数据集上评估了RELOCATE,建立了一种新的基线,该基线在时空平均精度上相较于先前任务特定方法提高了49%。
引用
@article{arxiv.2412.01826,
title = {RELOCATE: A Simple Training-Free Baseline for Visual Query Localization Using Region-Based Representations},
author = {Savya Khosla and Sethuraman T and Alexander Schwing and Derek Hoiem},
journal= {arXiv preprint arXiv:2412.01826},
year = {2025}
}