中文

用于提升强化学习鲁棒性的因果反事实方法

机器学习 2023-06-06 v3 人工智能 机器人学

摘要

强化学习(RL)被用于各种机器人应用中。RL 使智能体能够通过与环境的交互自主学习任务。任务越关键,对 RL 系统鲁棒性的要求就越高。因果 RL 结合了 RL 和因果推断,使 RL 更加鲁棒。因果 RL 智能体使用因果表示来捕获可以从一个任务转移到另一个任务的不变因果机制。目前,因果 RL 领域的研究有限,现有的解决方案通常不完整或难以应用于实际场景。在这项工作中,我们提出了 CausalCF,这是第一个结合了因果好奇心和 CoPhy 思想的完整因果 RL 解决方案。因果好奇心提供了一种使用干预的方法,而 CoPhy 被修改以使 RL 智能体能够执行反事实。因果好奇心已被应用于 CausalWorld 中的机器人抓取和操作任务。CausalWorld 提供了一个基于 TriFinger 机器人的逼真仿真环境。我们将 CausalCF 应用于复杂的机器人任务,并表明它使用 CausalWorld 提高了 RL 智能体的鲁棒性。

关键词

引用

@article{arxiv.2211.05551,
  title  = {Causal Counterfactuals for Improving the Robustness of Reinforcement Learning},
  author = {Tom He and Jasmina Gajcin and Ivana Dusparic},
  journal= {arXiv preprint arXiv:2211.05551},
  year   = {2023}
}

备注

Accepted to ARMS-2023 (ARMS-2023: AAMAS 2023 Workshop on Autonomous Robots and Multirobot Systems)