中文

可解释的端到端神经符号强化学习智能体

人工智能 2025-11-04 v2

摘要

深度强化学习(RL)智能体依赖于捷径学习,导致其无法从略微不同的环境中泛化。为解决此问题,已开发出使用对象中心状态的符号方法。然而,将这些方法与深度智能体进行比较是不公平的,因为后者仅能从原始像素状态中运行。在本文中,我们实现了符号 SCoBots 框架。SCoBots 将 RL 任务分解为中间、可解释的表示,最终基于一组可理解的对象中心关系概念做出行动决策。该架构有助于阐明智能体的决策过程。通过显式学习从原始状态中提取对象中心表示,实现对象中心 RL 和通过规则提取的策略蒸馏,本工作落实于神经符号 AI 范式,将神经网络与符号 AI 的优势融合。我们present了首个端到端训练的 SCoBot 实现,并在不同 Atari 游戏上分别评估了其组件。结果表明,该框架有潜力创建可解释且性能优异的 RL 系统,为获得端到端可解释 RL 智能体的未来研究方向铺平了道路。

关键词

引用

@article{arxiv.2410.14371,
  title  = {Interpretable end-to-end Neurosymbolic Reinforcement Learning agents},
  author = {Nils Grandien and Quentin Delfosse and Kristian Kersting},
  journal= {arXiv preprint arXiv:2410.14371},
  year   = {2025}
}

备注

19 pages; 5 figures; 3 tables