通过直接优化缓解基于树的强化学习中的信息损失
机器学习
2025-03-12 v5
摘要
强化学习(RL)在各个领域取得了显著成功,但其应用常因神经网络策略的黑箱性质而受到限制,使其难以解释。相比之下,符号策略能够以紧凑且可解释的方式表示决策策略。然而,在同策略方法中直接学习符号策略仍然具有挑战性。在本文中,我们引入了SYMPOL,一种用于基于树的同策略强化学习的符号化新方法。SYMPOL采用一种与策略梯度方法集成的基于树的模型,使智能体能够在保持高度可解释性的同时学习和适应其动作。我们在一组基准强化学习任务上评估了SYMPOL,证明了其在性能和可解释性方面优于其他基于树的强化学习方法。与现有方法不同,它能够在标准同策略强化学习算法中实现基于梯度的端到端学习可解释的轴对齐决策树。因此,SYMPOL可以成为基于决策树的可解释强化学习新类别的基础。我们的实现在以下地址可获取:https://github.com/s-marton/sympol
引用
@article{arxiv.2408.08761,
title = {Mitigating Information Loss in Tree-Based Reinforcement Learning via Direct Optimization},
author = {Sascha Marton and Tim Grams and Florian Vogt and Stefan Lüdtke and Christian Bartelt and Heiner Stuckenschmidt},
journal= {arXiv preprint arXiv:2408.08761},
year = {2025}
}