UrbanNav:从 Web 规模人类轨迹中学习语言引导的城市导航
机器人学
2026-01-16 v2 计算机视觉与模式识别
摘要
使用自然语言指令在复杂城市环境中进行导航对于具身智能体来说面临着诸多挑战,包括语言指令噪声、模糊的空间参考、多样化的地标以及动态的街道场景。当前的视觉导航方法通常仅限于模拟环境或非街道环境,往往依赖精确的目标格式,如特定坐标或图像。 这限制了其在类似后郊配送机器人这样的自主智能体 navigating 陌生城市时的有效性。 为了解决这些限制,我们提出了 UrbanNav 框架,通过 web 规模的城市步行视频训练具身智能体在多样化城市场景中遵循自由形式的语言指令。 我们开发了一种可扩展的标注流程,将人类导航轨迹与以真实世界地标为基础的语言指令对齐。 UrbanNav 包含超过 1500 小时的导航数据和 300 万条指令-轨迹-地标三元组,涵盖了广泛的城市情景。我们的模型学习了针对复杂城市情景的鲁棒导航策略,展示了卓越的空间推理能力、对噪声指令的鲁棒性,以及对未见城市环境的泛化能力。实验结果表明,UrbanNav 显著优于现有方法,凸显了大规模网页视频数据为具身智能体在真实城市中实现语言引导导航的潜力。
引用
@article{arxiv.2512.09607,
title = {UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories},
author = {Yanghong Mei and Yirong Yang and Longteng Guo and Qunbo Wang and Ming-Ming Yu and Xingjian He and Wenjun Wu and Jing Liu},
journal= {arXiv preprint arXiv:2512.09607},
year = {2026}
}
备注
9 pages, 5 figures, accepted to AAAI 2026. Project page:https://github.com/CASIA-IVA-Lab/UrbanNav