通过集值归纳规则学习合成强化学习策略
人工智能
2021-06-14 v1 机器学习
摘要
当今先进的强化学习算法产生黑盒策略,通常难以被人解释和信任。我们基于 CN2 规则挖掘算法引入一种策略蒸馏算法,将策略蒸馏为基于规则的决策系统。我们方法的核心在于,RL 过程不仅学习策略(从状态到动作的映射),还产生额外的元信息,例如指示替代动作质量的动作值。该元信息可表明对于某一状态是否存在多个近乎最优的动作。我们扩展 CN2,使其能利用关于同等优质动作的知识,将策略蒸馏为更少的规则,从而提升人的可解释性。然后,为确保规则解释有效且非退化的策略,我们引入一种细化算法,对规则进行微调以在环境中执行时获得良好性能。我们在 Mario AI 基准上展示了算法的适用性,该复杂任务需要包括神经网络在内的现代强化学习算法。我们生成的解释仅用少量规则就捕捉了所学策略,使人能够理解黑盒智能体学到了什么。源代码:https://gitlab.ai.vub.ac.be/yocoppen/svcn2
引用
@article{arxiv.2106.06009,
title = {Synthesising Reinforcement Learning Policies through Set-Valued Inductive Rule Learning},
author = {Youri Coppens and Denis Steckelmacher and Catholijn M. Jonker and Ann Nowé},
journal= {arXiv preprint arXiv:2106.06009},
year = {2021}
}
备注
17 pages, 4 figures. The final authenticated publication is available online at https://doi.org/10.1007/978-3-030-73959-1_15