基于二元反馈的可证明安全强化学习
机器学习
2022-10-27 v1 人工智能
机器学习
摘要
安全性在强化学习(RL)的许多应用中(无论是机器人、汽车还是医疗领域)都是至关重要的必需品。许多现有的安全强化学习方法依赖于接收数值安全反馈,但在许多情况下,这种反馈只能取二元值;即,在给定状态下某个动作是安全还是不安全。当反馈来自人类专家时尤其如此。因此,我们考虑在能够访问提供关于状态-动作对安全性的二元反馈的离线预言机时,进行可证明安全强化学习的问题。我们提供了一种新颖的元算法 SABRE,在能够访问适用于该设置的黑盒 PAC 强化学习算法的情况下,它可以应用于任何 MDP 设置。SABRE 将主动学习的概念应用于强化学习,以可证明地控制对安全预言机的查询次数。SABRE 通过迭代探索状态空间来寻找智能体当前对其安全性不确定的区域。我们的主要理论结果表明,在适当的技术假设下,SABRE 在训练期间绝不会采取不安全的动作,并保证以高概率返回一个近似最优的安全策略。我们讨论了如何将我们的元算法应用于理论框架和经验框架中研究的各种设置。
引用
@article{arxiv.2210.14492,
title = {Provable Safe Reinforcement Learning with Binary Feedback},
author = {Andrew Bennett and Dipendra Misra and Nathan Kallus},
journal= {arXiv preprint arXiv:2210.14492},
year = {2022}
}