中文

TrajRAG:用于零样本目标导航的几何-语义经验检索

计算机视觉与模式识别 2026-05-05 v1

摘要

现有的零样本目标导航 (ObjectNav) 方法常利用来自大型语言或视觉-语言模型的常识知识以指导导航。然而,这些知识源自互联网规模文本,而非具身 3D 经验,导航期间收集的情景观察通常被丢弃,阻碍了终身经验的积累。为此,我们提出轨迹 RAG (TrajRAG),一个检索增强生成框架,通过检索几何-语义经验来增强大型模型的推理能力。TrajRAG 逐步积累过去导航情景的观察。为结构化这些观察,我们提出拓扑极坐标 (topo-polar) 轨迹表示,紧凑编码空间布局和语义上下文,有效消除原始情景观察中的冗余。层次化块状结构进一步组织相似的 topo-polar 轨迹以统一摘要,实现粗到细检索。在导航期间,候选前沿生成多个轨迹假设查询 TrajRAG 获取类似过去轨迹,从而指导大型模型推理选择路标。新的经验持续整合到 TrajRAG 中,实现终身导航经验的积累。在 MP3D、HM3D-v1 和 HM3D-v2 上的实验表明,TrajRAG 有效检索相关几何-语义经验并提高了零样本 ObjectNav 性能。

关键词

引用

@article{arxiv.2605.01700,
  title  = {TrajRAG: Retrieving Geometric-Semantic Experience for Zero-Shot Object Navigation},
  author = {Yiyao Wang and Sixian Zhang and Keming Zhang and Xinhang Song and Songjie Du and Shuqiang Jiang},
  journal= {arXiv preprint arXiv:2605.01700},
  year   = {2026}
}

备注

Accepted by CVPR 2026