中文

用于强化学习策略 summarisation 的布尔决策规则

机器学习 2022-07-19 v1 人工智能

摘要

强化学习(RL)策略的可解释性仍是一个具有挑战性的研究问题,尤其在将 RL 置于安全背景中时。理解 RL 策略的决策与意图,可通过限制不良动作来将安全性引入策略。我们提出使用布尔决策规则模型来创建智能体策略的事后基于规则的摘要。我们使用在 lava gridworld 实现上训练的 DQN 智能体评估所提方法,并表明给定该 gridworld 的手工特征表示,可创建简单的泛化规则,给出智能体策略的事后可解释摘要。我们讨论了通过该基于规则的模型生成的规则作为施加于智能体策略的约束,从而将安全性引入 RL 智能体策略的可能途径,并讨论了创建智能体策略的简单规则摘要如何有助于 RL 智能体的调试过程。

关键词

引用

@article{arxiv.2207.08651,
  title  = {Boolean Decision Rules for Reinforcement Learning Policy Summarisation},
  author = {James McCarthy and Rahul Nair and Elizabeth Daly and Radu Marinescu and Ivana Dusparic},
  journal= {arXiv preprint arXiv:2207.08651},
  year   = {2022}
}