中文

利用 Actor-Critic 算法与 ReLU 网络合成程序化策略

机器学习 2023-08-08 v1

摘要

程序化可解释强化学习(PIRL)将策略编码为人类可读的计算机程序。近期引入了新颖算法,旨在应对程序化策略空间中缺乏梯度信号以引导搜索的问题。大多数此类 PIRL 算法首先训练一个神经策略作为预言机,以引导程序化空间中的搜索。本文中,我们表明此类 PIRL 专用算法并非必要,这取决于用于编码程序化策略的语言。这是因为可使用 actor-critic 算法直接获得程序化策略。我们利用 ReLU 神经网络与斜决策树之间的关联,将 actor-critic 算法学到的策略转化为程序化策略。这种从 ReLU 网络的转化使我们能够合成以 if-then-else 结构、输入值的线性变换和 PID 操作编码于程序中的策略。在多个控制问题上的实证结果表明,该转化方法能够学习到简短且有效的策略。此外,转化后的策略至少与 PIRL 算法合成的策略相当,且往往远优于后者。

关键词

引用

@article{arxiv.2308.02729,
  title  = {Synthesizing Programmatic Policies with Actor-Critic Algorithms and ReLU Networks},
  author = {Spyros Orfanos and Levi H. S. Lelis},
  journal= {arXiv preprint arXiv:2308.02729},
  year   = {2023}
}