中文

面向离线强化学习的真实世界四足运动基准

机器人学 2024-10-28 v1 机器学习

摘要

在线强化学习(RL)方法通常数据效率低或不可靠,难以在真实机器人硬件尤其是四足机器人上训练。从预采集数据学习机器人任务是大有前景的方向。同时,敏捷且稳定的腿式机器人运动在其一般形式上仍属开放问题。离线强化学习(ORL)有潜力在这一挑战性领域取得突破,但其当前瓶颈在于缺乏面向困难真实任务的多样数据集。为推进ORL发展,我们在真实四足运动数据集中对11种ORL算法进行了基准测试。该数据集由经典模型预测控制(MPC)方法收集,而非先前基准常用的无模型在线RL方法。大量实验结果表明,表现最优的ORL算法可取得与无模型RL相当的性能,并在部分任务中超越之。然而,基于学习的方法与MPC间仍存在差距,尤其在稳定性与快速适应方面。我们提出的基准将作为在真实腿式运动任务中测试与评估ORL算法性能的开发平台。

关键词

引用

@article{arxiv.2309.16718,
  title  = {A Real-World Quadrupedal Locomotion Benchmark for Offline Reinforcement Learning},
  author = {Hongyin Zhang and Shuyu Yang and Donglin Wang},
  journal= {arXiv preprint arXiv:2309.16718},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication