中文

利用多样化合作行为与对抗式风格采样增强多智能体强化学习中辅助任务策略的鲁棒性

机器人学 2024-04-02 v2 机器学习

摘要

对运动障碍人士的自主辅助是自主机器人系统最有前景的应用之一。最近的研究报告了深度强化学习(RL)在医疗领域取得的令人鼓舞的结果。先前的研究表明,辅助任务可以表述为多智能体 RL,其中包含两个智能体:护理者和被护理者。然而,在多智能体 RL 中训练的策略往往对其他智能体的策略敏感。在这种情况下,训练好的护理者策略可能不适用于不同的被护理者。为了缓解这一问题,我们提出了一个框架,通过针对多样化的被护理者反应进行训练,来学习鲁棒的护理者策略。在我们的框架中,多样化的被护理者反应是通过试错自主学习的。此外,为了增强护理者策略的鲁棒性,我们提出了一种在训练期间以对抗方式采样被护理者反应的策略。我们在 Assistive Gym 的任务中评估了所提出的方法。我们证明了使用流行深度 RL 方法训练的策略容易受到其他智能体策略变化的影响,而所提出的框架提高了针对此类变化的鲁棒性。

关键词

引用

@article{arxiv.2403.00344,
  title  = {Robustifying a Policy in Multi-Agent RL with Diverse Cooperative Behaviors and Adversarial Style Sampling for Assistive Tasks},
  author = {Takayuki Osa and Tatsuya Harada},
  journal= {arXiv preprint arXiv:2403.00344},
  year   = {2024}
}

备注

7 pages, accepted for ICRA 2024