中文

基于有限理性对抗强化学习的动态避障

机器人学 2025-03-17 v1 机器学习

摘要

强化学习(RL)已被证明在获取足式机器人的稳定运动步态方面非常有效。然而,设计能够鲁棒地导航具有障碍物的未见环境的控制算法仍然是四足运动中的一个持续存在的问题。为了解决这个问题,通过结合低层运动策略和高层导航策略的分层方法来求解导航任务是一种便捷的途径。至关重要的是,高层策略需要对智能体路径上的动态障碍物具有鲁棒性。在这项工作中,我们提出了一种赋予导航策略鲁棒性的新方法,该训练过程遵循对抗 RL 范式,将障碍物建模为对抗智能体。重要的是,为了提高训练过程的可靠性,我们利用量子响应均衡界定了对抗智能体的理性,并对其理性设置了课程。我们将此方法称为基于量子响应对抗强化学习的分层策略(Hi-QARL)。我们通过在具有多个障碍物的未见随机迷宫中进行基准测试来证明我们方法的鲁棒性。为了证明其在真实场景中的适用性,我们的方法在仿真中应用于 Unitree GO1 机器人。

关键词

引用

@article{arxiv.2503.11467,
  title  = {Dynamic Obstacle Avoidance with Bounded Rationality Adversarial Reinforcement Learning},
  author = {Jose-Luis Holgado-Alvarez and Aryaman Reddi and Carlo D'Eramo},
  journal= {arXiv preprint arXiv:2503.11467},
  year   = {2025}
}