中文

S-REINFORCE:一种用于可解释强化学习的神经符号策略梯度方法

机器学习 2023-05-15 v1 人工智能

摘要

本文提出一种新颖的强化学习算法 S-REINFORCE,旨在为动态决策任务生成可解释策略。所提算法利用两类函数逼近器,即神经网络(NN)和符号回归器(SR),分别生成数值策略和符号策略。NN 组件通过策略梯度学习生成关于可能动作的数值概率分布,而 SR 组件捕捉将相关状态与动作概率关联起来的函数形式。随后通过重要性采样利用 SR 生成的策略表达式来提升学习过程中获得的奖励。我们在具有低维和高维动作空间的各种动态决策问题上测试了所提 S-REINFORCE 算法,结果表明其在实现可解释解方面的有效性与作用。通过结合 NN 与 SR 的优势,S-REINFORCE 生成的策略不仅性能良好,而且易于解释,这使其成为透明性与因果性至关重要的现实应用的理想选择。

关键词

引用

@article{arxiv.2305.07367,
  title  = {S-REINFORCE: A Neuro-Symbolic Policy Gradient Approach for Interpretable Reinforcement Learning},
  author = {Rajdeep Dutta and Qincheng Wang and Ankur Singh and Dhruv Kumarjiguda and Li Xiaoli and Senthilnath Jayavelu},
  journal= {arXiv preprint arXiv:2305.07367},
  year   = {2023}
}

备注

10 pages, 7 figures