中文

MESA:面向安全适应与容错的离线元强化学习

机器学习 2021-12-08 v1 人工智能 机器人学

摘要

安全探索对于在风险敏感环境中使用强化学习(RL)至关重要。近期工作学习了衡量约束违反概率的风险度量,并可用于保障安全。然而,学习此类风险度量需要与环境的大量交互,导致学习过程中过度的约束违反。此外,这些度量不易迁移到新环境。我们将安全探索视为离线元RL问题,其目标是在多种环境中利用安全与不安全行为的样本,快速将学到的风险度量适应到具有前所未见动力学的新环境。我们进而提出MEta-learning for Safe Adaptation (MESA),一种用于安全RL的元学习风险度量方法。在5个连续控制领域的仿真实验表明,MESA可利用来自一系列不同环境的离线数据,在保持任务性能的同时,将未见环境中的约束违反最多降低至原来的1/2。代码与补充材料见 https://tinyurl.com/safe-meta-rl。

关键词

引用

@article{arxiv.2112.03575,
  title  = {MESA: Offline Meta-RL for Safe Adaptation and Fault Tolerance},
  author = {Michael Luo and Ashwin Balakrishna and Brijen Thananjeyan and Suraj Nair and Julian Ibarz and Jie Tan and Chelsea Finn and Ion Stoica and Ken Goldberg},
  journal= {arXiv preprint arXiv:2112.03575},
  year   = {2021}
}