中文

面向端到端训练代理的视觉导航推理:一种动力系统方法

机器人学 2025-04-16 v4 计算机视觉与模式识别 机器学习

摘要

嵌入式AI的进展使得能够在照片实况环境中进行高层次推理和零样本或语言条件化行为的端到端训练代理成为可能,但基准测试仍主要基于仿真。本文聚焦于快速移动真实机器人行为的细粒度分析,展开大规模实验研究,涉及 numepisodes 个导航 episode 在真实环境中的实现,我们分析了端到端训练从中涌现的推理类型。特别是,我们研究了真实动力学是否被代理学习,用于开放式预测,其与感知的相互作用。我们分析了代理如何使用潜在记忆来保存场景结构元素和在探索期间收集的信息。我们探讨了代理的规划能力,发现其记忆中存在对有限时域内相当精确计划的证据。进一步,我们在事后分析中表明,代理所学习的价值函数与长期规划相关。综上,我们的实验描绘了一种新的图景,说明计算机视觉和顺序决策工具的运用如何导致机器人和控制领域的新能力。一个交互式工具可在 europe.naverlabs.com/research/publications/reasoning-in-visual-navigation-of-end-to-end-trained-agents 查阅。

关键词

引用

@article{arxiv.2503.08306,
  title  = {Reasoning in visual navigation of end-to-end trained agents: a dynamical systems approach},
  author = {Steeven Janny and Hervé Poirier and Leonid Antsfeld and Guillaume Bono and Gianluca Monaci and Boris Chidlovskii and Francesco Giuliari and Alessio Del Bue and Christian Wolf},
  journal= {arXiv preprint arXiv:2503.08306},
  year   = {2025}
}