GeoLoco:利用视觉基础模型获取的3D几何先验实现基于RGB的稳健人形体 locomotion
机器人学
2026-03-10 v1
摘要
当前的人形体感知式 locomotion 范式严重依赖主动深度传感器。然而,这种基于深度的方法本质上丢弃了视觉世界中丰富的语义和密集表面线索,使低层控制与实现通用具身智能所必需的高层推理断裂。虽然单目 RGB 提供了普适且信息密集的替代方案,但从原始2D像素进行的端到端强化学习 suffers from 极端样本效率低下和灾难性 sim-to-real 崩溃,due to 几何尺度的固有丢失。为打破这一僵局,我们提出了 GeoLoco 框架,将单目图像概念化为高维3D潜在表示,利用冻结的、尺度感知的视觉基础模型(VFM)获取强大的几何先验。我们设计了一种 proprioceptive-query 多头交叉注意力机制,动态地注意于以机器人实时步态相位为条件的任务关键拓扑特征。关键的是,为了防止策略对浅显纹理过拟合,我们引入了双头辅助学习方案。这种显式正则化迫使高维潜在空间严格对齐物理地形几何,从而确保稳健的零样本 sim-to-real 迁移。仅在仿真中训练的 GeoLoco 能够实现对 Unitree G1 人形体的稳健零样本迁移,并成功地驾驭具有挑战性的 terrain。
引用
@article{arxiv.2603.07624,
title = {GeoLoco: Leveraging 3D Geometric Priors from Visual Foundation Model for Robust RGB-Only Humanoid Locomotion},
author = {Yufei Liu and Xieyuanli Chen and Hainan Pan and Chenghao Shi and Yanjie Chen and Kaihong Huang and Zhiwen Zeng and Huimin Lu},
journal= {arXiv preprint arXiv:2603.07624},
year = {2026}
}
备注
8 pages, 6 figures, conference