DPL:基于真实深度合成和跨注意力地形重建的深度感知人oid locomotion
机器人学
2025-10-13 v2
摘要
最近的四足机器人感知式 locomotion 取得了显著进展。然而,基于地形的 humanoid locomotion 仍主要受限于两种范式:基于深度图像的端到端学习和基于等高图的方法。前者存在训练效率低和显著 sim-to-real 差距的问题,而后者依赖多个视觉传感器和定位系统,导致延迟和鲁棒性下降。为克服这些挑战,我们提出一种新框架,紧密集成三个关键组件:(1)具备盲目主干网络的 Terrain-Aware Locomotion Policy,利用预训练的等高图感知方法以最小视觉输入引导强化学习;(2)多模态跨注意力变换器,重构来自噪声深度图像的结构化地形表示;(3)真实深度图像合成方法,采用自遮蔽感知的射线投射和噪声感知建模以合成真实的深度观测,实现terrain reconstruction error 降低超过 30%。这种组合使我们能够在有限数据和硬件资源下进行高效策略训练,同时保留对泛化至关重要的关键地形特征。我们在一台全尺寸 humanoid 机器人上验证了该框架,展示了在多样且具挑战性的地形上进行灵活且自适应 locomotion 的能力。
引用
@article{arxiv.2510.07152,
title = {DPL: Depth-only Perceptive Humanoid Locomotion via Realistic Depth Synthesis and Cross-Attention Terrain Reconstruction},
author = {Jingkai Sun and Gang Han and Pihai Sun and Wen Zhao and Jiahang Cao and Jiaxu Wang and Yijie Guo and Qiang Zhang},
journal= {arXiv preprint arXiv:2510.07152},
year = {2025}
}