图像目标导航到底真正重要的是什么?
计算机视觉与模式识别
2026-02-04 v3 机器人学
摘要
图像目标导航需要两种不同的技能:首先是核心导航技能,包括对自由空间和障碍物的检测,以及基于内部表征做出决策;其次是通过将视觉观察与目标图像进行比较来计算方向信息。当前的最先进方法要么依赖专门的图像匹配,要么在相对位姿估计上进行预训练。本文我们研究了这一任务是否可以仅通过强化学习对完整智能体进行端到端训练来高效解决,正如最近的工作所声称的那样。一个积极的答案将超越具身人工智能,允许仅从导航奖励来训练相对位姿估计。本文进行了大量实验研究,探讨了诸如晚期融合、通道堆叠、空间到深度投影和跨注意力等架构选择的效果,以及这些选择在导航训练中相对位姿估计器涌现的作用。我们展示了最近方法的成功程度在一定程度上受到仿真器设置的影响,导致仿真中的捷径。然而,我们也表明,这些能力可以转移到更真实的设置中,尽管有一定程度的限制。我们还发现导航性能与探测到的(涌现的)相对位姿估计性能之间存在相关性,这是一个重要的子技能。
引用
@article{arxiv.2507.01667,
title = {What does really matter in image goal navigation?},
author = {Gianluca Monaci and Philippe Weinzaepfel and Christian Wolf},
journal= {arXiv preprint arXiv:2507.01667},
year = {2026}
}