中文

E-SDS:面向环境感知的见识-行动-排序 - 人类机器人 locomotion 中的环境感知强化学习自动化

机器人学 2025-12-19 v1 人工智能

摘要

视觉语言模型(VLMs)在人类机器人 locomotion 中自动化奖励设计方面显示出巨大的潜力,这可以消除对繁琐手动工程的需求。然而,当前基于 VLM 的方法本质上是“盲目的”,因为它们缺乏对复杂地形所需的环境感知能力以进行导航。我们提出了 E-SDS(Environment-aware See it, Do it, Sorted),一个弥合这一感知鸿沟的框架。E-SDS 将 VLMs 与实时地形传感器分析集成,自动生成有助于训练鲁棒感知 locomotion 策略的奖励函数,这些策略以示例视频为依据。 在 Unitree G1 人类机器人上进行评估,E-SDS 在四种不同地形(简单、间隙、障碍、楼梯)中均取得成功,其中唯一实现了楼梯下坠,而使用手动设计的奖励或非感知自动基线训练的策略无法完成该任务。在所有地形上,E-SDS 还将速度跟踪误差降低了 51.9-82.6%。我们的框架将奖励设计的人类工作量从几天减少到不到两小时,同时产生更具鲁棒性和能力的 locomotion 策略。

关键词

引用

@article{arxiv.2512.16446,
  title  = {E-SDS: Environment-aware See it, Do it, Sorted - Automated Environment-Aware Reinforcement Learning for Humanoid Locomotion},
  author = {Enis Yalcin and Joshua O'Hara and Maria Stamatopoulou and Chengxu Zhou and Dimitrios Kanoulas},
  journal= {arXiv preprint arXiv:2512.16446},
  year   = {2025}
}

备注

12 pages, 3 figures, 4 tables. Accepted at RiTA 2025 (Springer LNNS)