PRVQL:面向鲁棒自我中心视觉查询定位的渐进式知识引导精炼
计算机视觉与模式识别
2025-07-02 v2
摘要
自我中心视觉查询定位(EgoVQL)旨在给定视觉查询的情况下,从第一人称视频中在空间与时间上定位感兴趣的目标。尽管近期取得了一定进展,但由于缺乏充足的目标线索,现有方法往往难以处理视频中严重的物体外观变化与杂乱背景,从而导致性能退化。针对此问题,我们提出了 PRVQL,一种用于 EgoVQL 的新型渐进式知识引导精炼框架。其核心是直接从视频中持续提取与目标相关的知识,并将其作为引导来精炼查询与视频特征,以改善目标定位。我们的 PRVQL 包含多个处理阶段。某一阶段的目标知识(包含通过两个专门设计的知识学习模块提取的外观知识与空间知识)被用作引导,以精炼下一阶段的查询与视频特征,进而用于生成更准确的知识以供进一步特征精炼。通过这种渐进式过程,PRVQL 中的目标知识得以逐步提升,进而为最终阶段的定位提供更好的精炼查询与视频特征。与以往方法相比,我们的 PRVQL 除了利用给定的物体线索外,还从视频中获取额外的关键目标信息作为引导来精炼特征,从而增强了在复杂场景下的 EgoVQL。在具有挑战性的 Ego4D 数据集上的实验中,PRVQL 取得了 SOTA 结果并大幅超越其他方法,证明了其有效性。我们的代码、模型与结果将发布于 https://github.com/fb-reps/PRVQL。
关键词
引用
@article{arxiv.2502.07707,
title = {PRVQL: Progressive Knowledge-guided Refinement for Robust Egocentric Visual Query Localization},
author = {Bing Fan and Yunhe Feng and Yapeng Tian and James Chenhao Liang and Yuewei Lin and Yan Huang and Heng Fan},
journal= {arXiv preprint arXiv:2502.07707},
year = {2025}
}