通过策略提取实现可验证强化学习
机器学习
2019-01-25 v2 机器学习
摘要
尽管深度强化学习已成功解决许多具有挑战性的控制任务,其实用性因无法确保所学策略的安全性而受限。我们提出一种通过训练决策树策略实现可验证强化学习的方法,决策树策略可表示复杂策略(因其为非参数模型),又可使用现有技术高效验证(因其高度结构化)。挑战在于决策树策略难以训练。我们提出VIPER,一种结合模型压缩与模仿学习思想的算法,以DNN策略(称为预言机)及其Q函数为指导学习决策树策略,并展示其大幅优于两个基线。我们使用VIPER来:(i) 为具有符号状态空间的Atari Pong变体学习可证明鲁棒的决策树策略;(ii) 为基于Pong的玩具游戏学习可证明永不失败的决策树策略;(iii) 为cart-pole学习可证明稳定的决策树策略。在每种情况下,决策树策略均达到与原DNN策略相当的性能。
引用
@article{arxiv.1805.08328,
title = {Verifiable Reinforcement Learning via Policy Extraction},
author = {Osbert Bastani and Yewen Pu and Armando Solar-Lezama},
journal= {arXiv preprint arXiv:1805.08328},
year = {2019}
}