中文

CReF:基于跨模态和循环融合的深度条件人类oid运动

机器人学 2026-04-02 v2

摘要

几何复杂地形上的稳定遍历日益需要外感知能力,但先前的人类oid运动方法往往仍依赖于显式几何抽象,或通过机器人中心的2.5D地形表示来进行控制,或通过与辅助几何相关目标相关联来塑造深度学习。此类设计继承了中间或监督目标的表征偏差,对于垂直结构、穿透式障碍物和复杂现实环境杂乱情况具有限制性。我们提出CReF(Cross-modal and Recurrent Fusion),一个单阶段深度条件人类oid运动框架,直接从原始前视深度深度学习中提取运动相关特征,而无需显式的几何中间表示。CReF通过 proprioception-queried 跨模态注意力将 proprioception 与深度标记进行耦合,将得到的表征与带门控残差融合块相融合,并通过受 highway 风格输出门调节的门控循环单元(GRU)进行时序集成,以实现递归特征和前馈特征在状态依赖下的混合。为进一步提高地形交互,我们引入基于地形的脚掌位置奖励,从脚端点云样本中提取支撑性脚掌候选位置,并奖励接触位置靠近最近支撑性候选位置的落点。在仿真和物理人类oid上进行的实验表明,该方法能够在多样化地形上实现稳健遍历,并有效地零样本迁移到包含手rail、空心托盘装配物、严重反射干扰以及视觉杂乱户外环境的真实场景。

关键词

引用

@article{arxiv.2603.29452,
  title  = {CReF: Cross-modal and Recurrent Fusion for Depth-conditioned Humanoid Locomotion},
  author = {Yuan Hao and Ruiqi Yu and Shixin Luo and Guoteng Zhang and Jun Wu and Qiuguo Zhu},
  journal= {arXiv preprint arXiv:2603.29452},
  year   = {2026}
}