中文

DPL:基于真实深度合成和跨注意力地形重建的深度感知人oid locomotion

机器人学 2025-10-13 v2

摘要

最近的四足机器人感知式 locomotion 取得了显著进展。然而,基于地形的 humanoid locomotion 仍主要受限于两种范式:基于深度图像的端到端学习和基于等高图的方法。前者存在训练效率低和显著 sim-to-real 差距的问题,而后者依赖多个视觉传感器和定位系统,导致延迟和鲁棒性下降。为克服这些挑战,我们提出一种新框架,紧密集成三个关键组件:(1)具备盲目主干网络的 Terrain-Aware Locomotion Policy,利用预训练的等高图感知方法以最小视觉输入引导强化学习;(2)多模态跨注意力变换器,重构来自噪声深度图像的结构化地形表示;(3)真实深度图像合成方法,采用自遮蔽感知的射线投射和噪声感知建模以合成真实的深度观测,实现terrain reconstruction error 降低超过 30%。这种组合使我们能够在有限数据和硬件资源下进行高效策略训练,同时保留对泛化至关重要的关键地形特征。我们在一台全尺寸 humanoid 机器人上验证了该框架,展示了在多样且具挑战性的地形上进行灵活且自适应 locomotion 的能力。

关键词

引用

@article{arxiv.2510.07152,
  title  = {DPL: Depth-only Perceptive Humanoid Locomotion via Realistic Depth Synthesis and Cross-Attention Terrain Reconstruction},
  author = {Jingkai Sun and Gang Han and Pihai Sun and Wen Zhao and Jiahang Cao and Jiaxu Wang and Yijie Guo and Qiang Zhang},
  journal= {arXiv preprint arXiv:2510.07152},
  year   = {2025}
}