中文

Hydra-Nav:基于自适应双进程推理的对象导航

机器人学 2026-02-11 v1

摘要

虽然大型视觉语言模型(VLM)在对象目标导航中显示出前景,但当前方法仍在成功率和对未见对象的高效定位方面受限——这些失败主要归因于弱的时间-空间推理。与此同时,最近尝试将推理注入 VLM 代理以提高成功率,但会产生 substantial 计算开销。为解决上述无效性和效率性问题,我们引入 Hydra-Nav,一个统一的 VLM 架构,能够自适应地在用于分析探索历史并制定高层计划的 deliberative 慢系统之间,以及用于高效执行的 reactive 快系统之间进行切换。我们通过三个阶段的课程训练 Hydra-Nav:(i)空间-动作对齐以强化轨迹规划,(ii)记忆-推理集成以增强对长期探索的时间-空间推理,(iii)迭代拒绝精调以在关键决策点实现选择性推理。广泛的实验表明,Hydra-Nav 在 HM3D、MP3D 和 OVON 基准上实现了最先进的性能,分别超过第二名方法 11.1%、17.4% 和 21.2%。此外,我们引入 SOT(Success weighted by Operation Time),以衡量不同推理强度下 VLM 之间的搜索效率。结果表明,自适应推理显著提高了相对于固定频率基线的搜索效率。

关键词

引用

@article{arxiv.2602.09972,
  title  = {Hydra-Nav: Object Navigation via Adaptive Dual-Process Reasoning},
  author = {Zixuan Wang and Huang Fang and Shaoan Wang and Yuanfei Luo and Heng Dong and Wei Li and Yiming Gan},
  journal= {arXiv preprint arXiv:2602.09972},
  year   = {2026}
}