中文

使用批评家调导的进化:面向强化学习代理的人类可读程序

机器学习 2024-10-30 v1 人工智能

摘要

随着深度强化学习(DRL)越来越多地用于控制现实系统,基于RL核心的神经网络的透明度不足成为一项顾虑。程序化强化学习(PRL)能够以源代码形式创建这种黑箱的表征,不仅提高了控制器的可解释性,也允许用户进行定制。然而,这些方法侧重于从学习后的黑箱策略中提炼出程序,并仅使用生产结果与期望结果之间的均方误差(MSE)进行提炼,抛弃了RL算法的其他要素。因此,提炼出的策略可能会显著低于黑箱学习策略的性能。本文提出了直接学习作为RL代理策略的人类可读程序。我们基于TD3并以其批评家为目标函数的遗传算法基础,以合成程序为目标。我们的做法在训练期间构建程序,而非事后进行,从而将程序引导至实际的高回报,而不仅仅是简单的均方误差。此外,我们的做法利用TD3批评家实现高样本效率,区别于纯粹的遗传方法后者依赖蒙特卡洛评估。我们的实验在简单网格世界环境中展示了我们方法的有效性、可解释性和样本效率。

关键词

引用

@article{arxiv.2410.21940,
  title  = {Human-Readable Programs as Actors of Reinforcement Learning Agents Using Critic-Moderated Evolution},
  author = {Senne Deproost and Denis Steckelmacher and Ann Nowé},
  journal= {arXiv preprint arXiv:2410.21940},
  year   = {2024}
}

备注

Accepted in BNAIC/BeNeLearn 2024 conference proceedings