中文

GalilAI:基于因果主动实验的离任务分布检测用于安全迁移强化学习

机器学习 2021-11-01 v1 人工智能

摘要

离分布(OOD)检测是监督学习中一个被充分研究的课题。然而,由于数据生成过程——强化学习(RL)智能体主动向其环境查询数据,且数据是智能体所遵循策略的函数——将监督学习方法的成功扩展到强化学习设定是困难的。若智能体的策略未引导其探索发生偏移的环境方面,它便可能忽略环境的变化。因此,为实现RL中安全且鲁棒的泛化,存在通过主动实验进行OOD检测的未满足需求。在此,我们试图弥合这一空白:首先定义RL智能体在真实环境中遇到的OOD情景或环境的因果框架;进而提出一项新任务:离任务分布(OOTD)检测。我们引入一个在测试环境中主动实验并随后判断其是否为OOTD的RL智能体。我们将该方法命名为GalilAI,以纪念伽利略·伽利雷,因为它除其他因果过程外,发现了引力加速度与物体质量无关。最后,我们提出一个用于比较的简单概率神经网络基线,其扩展了现有的基于模型的RL。我们发现GalilAI显著优于该基线。方法可视化见 https://galil-ai.github.io/

关键词

引用

@article{arxiv.2110.15489,
  title  = {GalilAI: Out-of-Task Distribution Detection using Causal Active Experimentation for Safe Transfer RL},
  author = {Sumedh A Sontakke and Stephen Iota and Zizhao Hu and Arash Mehrjou and Laurent Itti and Bernhard Schölkopf},
  journal= {arXiv preprint arXiv:2110.15489},
  year   = {2021}
}