中文

EAGLE:基于情景外观与几何感知记忆的统一 2D-3D 视觉查询定位框架(以原发性视觉为例)

计算机视觉与模式识别 2025-11-13 v2

摘要

原发性视觉查询定位对于具身 AI 和 VR/AR 至关重要,但由于相机运动、视点变化和外观变异,仍面临挑战。我们提出 EAGLE,一种新型框架,利用情景外观与几何感知记忆,实现原发性视觉中的统一 2D-3D 视觉查询定位。灵感来自鸟类记忆巩固机制,EAGLE 将由外观感知元学习记忆(AMM)驱动的分段引导,与由几何感知定位记忆(GLM)驱动的跟踪相结合。通过结构化的外观和几何记忆库存储高置信度检索样本,有效支持目标外观变异的长期和短期建模。这实现了具有鲁棒空间判别能力的精确轮廓描绘,显著提高检索准确性。此外,通过将 VQL-2D 输出与基于视觉几何的 Transformer(VGGT)集成,我们实现了 2D 和 3D 任务的高效统一,使其能够快速准确地投射到 3D 空间。我们的方法在 Ego4D-VQ 数据集上实现了最先进的性能。

关键词

引用

@article{arxiv.2511.08007,
  title  = {EAGLE: Episodic Appearance- and Geometry-aware Memory for Unified 2D-3D Visual Query Localization in Egocentric Vision},
  author = {Yifei Cao and Yu Liu and Guolong Wang and Zhu Liu and Kai Wang and Xianjie Zhang and Jizhe Yu and Xun Tu},
  journal= {arXiv preprint arXiv:2511.08007},
  year   = {2025}
}

备注

13 Pages, accepted by AAAI-2026