CityWalker:从网络大规模视频中学习具身城市导航
计算机视觉与模式识别
2025-04-23 v3 机器人学
摘要
具身智能体在动态城市环境中导航面临重大挑战,要求具备先进的空间推理能力并遵循常识规范。尽管已有进展,现有视觉导航方法在无地图或非街道环境中表现有限,限制了类似末级配送机器人等自主智能体的实际应用。为此,我们提出一种可扩展的数据驱动方法,通过在网络上获取的大量街景步行和驾驶视频进行训练,实现类人城市导航。我们引入一个简单且可扩展的数据处理管道,从这些视频中提取动作监督信号,实现大规模模仿学习,无需昂贵的标注。我们的模型学习到处理多样挑战和关键情景的复杂导航策略。实验结果表明,训练于大规模多样化数据集显著提升了导航性能,超越当前方法。本工作表明,利用丰富的在线视频数据可为动态城市环境中的具身智能体开发鲁棒的导航策略具有巨大潜力。项目主页为https://ai4ce.github.io/CityWalker/。
引用
@article{arxiv.2411.17820,
title = {CityWalker: Learning Embodied Urban Navigation from Web-Scale Videos},
author = {Xinhao Liu and Jintong Li and Yicheng Jiang and Niranjan Sujay and Zhicheng Yang and Juexiao Zhang and John Abanes and Jing Zhang and Chen Feng},
journal= {arXiv preprint arXiv:2411.17820},
year = {2025}
}
备注
Accepted to CVPR 2025