SteadyTray:通过残差强化学习学习人oid tray 运输中的对象平衡任务
机器人学
2026-03-12 v1
摘要
在非结构化环境中稳定未固定有效载荷以抵御动态双足行走的固有振荡,仍是人oid系统的关键工程瓶颈。为解决此问题,我们引入ReST-RL,这是一种分层强化学习架构,显式地将 locomotion 与有效载荷稳定性解耦,由SteadyTray基准进行评估。我们的框架整合了稳健的基座 locomotion 策略与一个动态残差模块,后者被设计用于主动消除行走引起的末端执行器扰动。这种架构分离确保了在不损害底层双足稳定性的前提下实现稳定的 tray 运输。在仿真中,残差设计在步态平滑性和姿态精度方面显著优于端到端基线,实现了96.9%的可变速度跟踪成功率和74.5%的外部力扰动鲁棒性。成功部署在Unitree G1人oid硬件上,该模块化方法在各种对象和外部力扰动下实现了高度可靠的零-shot仿真到现实的泛化。
引用
@article{arxiv.2603.10306,
title = {SteadyTray: Learning Object Balancing Tasks in Humanoid Tray Transport via Residual Reinforcement Learning},
author = {Anlun Huang and Zhenyu Wu and Soofiyan Atar and Yuheng Zhi and Michael Yip},
journal= {arXiv preprint arXiv:2603.10306},
year = {2026}
}
备注
Project website: https://steadytray.github.io/