中文

从看到到体验:用强化学习扩展导航基础模型

计算机视觉与模式识别 2025-07-30 v1 机器人学

摘要

在海量网络规模数据上训练的导航基础模型使智能体能够泛化到不同的环境和具身形态。然而,这些仅在离线数据上训练的模型通常缺乏推理其行动后果或通过反事实理解进行适应的能力。因此,它们在现实世界的城市导航中面临重大限制,在这些导航中,交互式和安全行为(例如避开障碍物和移动的行人)至关重要。为了应对这些挑战,我们引入了 Seeing-to-Experiencing 框架,以利用强化学习扩展导航基础模型的能力。S2E 结合了视频预训练和通过 RL 进行后训练的优势。它保持了从大规模真实世界视频中获得的泛化能力,同时通过在模拟环境中的 RL 增强了其交互性。具体来说,我们引入了两项创新:Anchor-Guided Distribution Matching 策略,通过基于锚点的监督稳定学习并建模多样的运动模式;以及 Residual-Attention Module,从模拟环境中获取反应性行为而不抹除模型的预训练知识。此外,我们建立了一个全面的端到端评估基准 NavBench-GS,该基准建立在真实世界场景的逼真 3DGS 重建之上,并结合了物理交互。它可以系统地评估导航基础模型的泛化能力和安全性。大量实验表明,S2E 减轻了单独使用离线数据进行扩展时经常出现的边际收益递减。我们详细分析了在机器人学习的后训练背景下,强化学习与监督微调相比的优势。我们的发现强调了整合交互式在线体验以有效扩展机器人领域基础模型的关键作用。

关键词

引用

@article{arxiv.2507.22028,
  title  = {From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning},
  author = {Honglin He and Yukai Ma and Wayne Wu and Bolei Zhou},
  journal= {arXiv preprint arXiv:2507.22028},
  year   = {2025}
}