从灾难性动作后果中学习护盾:绝不重蹈覆辙
机器学习
2022-02-22 v1 人工智能
摘要
在未知环境中运行的智能体在学习过程中难免犯错,其中至少偶尔会包含一些导致灾难性后果的错误。当人类犯下灾难性错误时,他们被期望学会永不重犯,例如幼儿触摸热炉后立刻学会绝不再做。本文考虑一类称为具有灾难性动作的POMDP(POMDP-CA)的新型POMDP,其中状态与动作的配对被标记为灾难性。在POMDP-CA中行动的智能体事先并不知道哪些(状态,动作)对是灾难性的,因此在尝试学习任何有意义策略时必定会犯错。相反,它们的目标是在永不重复错误的同时最大化奖励。作为避免重复犯错的第一步,我们利用护盾概念来阻止智能体从特定状态执行特定动作。具体而言,我们将智能体所犯的灾难性错误(不安全的状态-动作对)存储于数据库中。随后禁止智能体选择数据库中出现的动作。该方法在持续学习设定中尤为有用,其中多组智能体随时间在同一底层环境中执行多种任务。在此设定下,可构建与任务无关的护盾,存储任意智能体所犯的错误,从而一旦组内某一智能体犯错,整个组都学会永不重复该错误。本文引入一种利用该护盾的PPO算法变体,称为ShieldPPO,并在受控环境中进行经验评估。结果表明,在一系列设定中ShieldPPO优于PPO以及安全强化学习文献中的基线方法。
引用
@article{arxiv.2202.09516,
title = {Learning a Shield from Catastrophic Action Effects: Never Repeat the Same Mistake},
author = {Shahaf S. Shperberg and Bo Liu and Peter Stone},
journal= {arXiv preprint arXiv:2202.09516},
year = {2022}
}