中文

BASIL:用于演化紧凑强化学习策略的最佳动作符号可解释学习

人工智能 2025-06-12 v3

摘要

寻求可解释的强化学习是将自主决策系统部署于安全关键应用中的一项重大挑战。现代深度强化学习方法虽然强大,但往往产生不透明的策略,从而妨碍验证、降低透明度并阻碍人类监督。为了解决这个问题,我们引入了 BASIL(最佳动作符号可解释学习,Best-Action Symbolic Interpretable Learning),这是一种通过带有质量多样性优化的在线进化搜索来生成符号化、基于规则的策略的系统方法。BASIL 将策略表示为状态变量上符号谓词的有序列表,确保了完全的可解释性和易于处理的策略复杂度。通过使用 QD 存档,本研究提出的方法鼓励表现优异的解之间在行为和结构上的多样性,而复杂度感知适应度则鼓励合成紧凑的表示。该进化系统支持对规则数量使用精确约束,并支持系统在平衡透明度与表达能力方面的适应性。与三个基准任务 CartPole-v1、MountainCar-v0 和 Acrobot-v1 的实证比较表明,BASIL 能够持续合成具有紧凑表示的可解释控制器,其性能可与深度强化学习基线相媲美。在本文中,本文介绍了一种新的可解释策略合成方法,该方法通过一个统一框架结合了符号表达能力、进化多样性和在线学习。

关键词

引用

@article{arxiv.2506.00328,
  title  = {BASIL: Best-Action Symbolic Interpretable Learning for Evolving Compact RL Policies},
  author = {Kourosh Shahnazari and Seyed Moein Ayyoubzadeh and Mohammadali Keshtparvar},
  journal= {arXiv preprint arXiv:2506.00328},
  year   = {2025}
}