自动机学习遇上屏蔽
机器学习
2022-12-06 v1 计算机科学中的逻辑
摘要
安全性仍是强化学习(RL)中的主要研究挑战之一。本文中,我们解决如何在概率性且部分未知的环境中避免 RL 智能体在探索期间发生安全违规的问题。我们的方法将马尔可夫决策过程(MDP)的自动机学习与屏蔽合成以迭代方式结合。初始时,表示环境的 MDP 未知。智能体开始探索环境并收集轨迹。从收集的轨迹中,我们被动学习抽象表示环境安全相关方面的 MDP。给定学习到的 MDP 与安全规约,我们构造一个屏蔽。对于学习到的 MDP 中每个状态-动作对,屏蔽计算执行该动作在接下来 步内从当前状态违反规约的精确概率。屏蔽构造后,在运行时使用屏蔽并阻断任何来自智能体、引发过大风险的动作。被屏蔽的智能体继续探索环境并收集关于环境的新数据。迭代地,我们利用收集的数据学习精度更高的新 MDP,进而得到能阻止更多安全违规的屏蔽。我们实现了该方法并给出了一个 Q-learning 智能体探索易滑 Gridworld 的详细案例研究。实验中,我们表明随着智能体在训练期间对环境探索得越来越多,经改进的学习模型带来了能阻止许多安全违规的屏蔽。
引用
@article{arxiv.2212.01838,
title = {Automata Learning meets Shielding},
author = {Martin Tappler and Stefan Pranger and Bettina Könighofer and Edi Muškardin and Roderick Bloem and Kim Larsen},
journal= {arXiv preprint arXiv:2212.01838},
year = {2022}
}