中文

HERO-VQL:层次化、站姿视角下的鲁棒视觉查询定位

计算机视觉与模式识别 2025-09-03 v1

摘要

本文聚焦于站姿视觉查询定位(VQL)问题,即模型需在长时段站姿视频中定位查询目标。站姿视频中频繁且突变的视角变化导致目标外观显著变化和局部遮挡,使得现有方法难以实现精准定位。为应对这些挑战,我们提出了层次化、站姿视角下鲁棒的视觉查询定位方法(HERO-VQL),其灵感来源于人类对象识别中认知过程。我们提出了两项创新:① 顶部注意力引导(TAG);② 基于一致性训练的站姿数据增强(EgoACT)。TAG通过利用类别标记获取高层语境信息,结合主成分得分图实现细粒度定位,从而细化注意力机制。在多样化且具挑战性的匹配场景中,EgoAug通过替换查询对象为地面真实标注中随机选取的对应对象,模拟极端视角变化的方式重新排序视频帧,以增强查询多样性。此外,CT损失 enforces 查询在不同增强场景下的稳定定位。大量实验表明,HERO-VQL在VQ2D数据集上有效处理站姿挑战,显著优于基线方法。

关键词

引用

@article{arxiv.2509.00385,
  title  = {HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization},
  author = {Joohyun Chang and Soyeon Hong and Hyogun Lee and Seong Jong Ha and Dongho Lee and Seong Tae Kim and Jinwoo Choi},
  journal= {arXiv preprint arXiv:2509.00385},
  year   = {2025}
}

备注

Accepted to BMVC 2025 (Oral), 23 pages with supplementary material