中文

基于强化学习的球滚机器人在不均匀地形导航

机器人学 2026-02-02 v2 人工智能 机器学习

摘要

球滚机器人(即球体平衡机器人)的导航通常依赖控制论(CT)的方法,而将强化学习(RL)应用于该问题的研究仍很少,且通常仅限于特定子任务(如平衡恢复)。与基于控制论的方法不同,RL不需要关于环境动力学的(简化)假设(例如球体与地板之间不存在打滑)。除了在建模方面的更高精度外,RL智能体还可以轻松地基于额外观察(如深度图)进行条件化,从而提高适应性。尽管有上述优势,针对基于RL的方法在球滚控制和导航方面的能力、数据效率及局限性的研究仍很少。此外,目前几乎没有一个面向RL的开源模拟器用于该任务。本文提出了一个基于MuJoCo的开源球滚模拟器,展示了在对外部感知观察进行适当条件化以及奖励塑形后,基于经典模型无监督RL方法学习的策略能够有效地通过随机生成的不均匀地形导航,所需数据量为4至5小时(运行于500Hz的系统上)。我们的代码已公开发布。

关键词

引用

@article{arxiv.2505.18417,
  title  = {Reinforcement Learning for Ballbot Navigation in Uneven Terrain},
  author = {Achkan Salehi},
  journal= {arXiv preprint arXiv:2505.18417},
  year   = {2026}
}

备注

6 pages, 9 figures, 2 tables. Version two corrects figure 4 and adds some experiments