中文

BlendRL:融合符号与神经策略学习的框架

机器学习 2025-04-22 v2 人工智能

摘要

人类能够利用符号推理和直觉反应。相比之下,强化学习策略通常以神经网络等不透明系统或依赖预定义符号和规则的符号系统形式编码。这种非均衡的方法严重限制了代理人的能力,因为它们往往缺乏神经代理人所特有的灵活低级反应特性,或缺乏符号代理人所具备的可解释推理能力。为克服这一挑战,我们引入BlendRL,一种融合符号与神经 RL 框架,能够在 RL 代理人中和谐地集成两大范式,使其使用逻辑与神经策略的混合形式。我们经验性地展示了BlendRL 代理人在标准 Atari 环境中超越了神经和符号基线,并展示了其对环境变化的鲁棒性。此外,我们分析了神经与符号策略之间的相互作用,说明其混合使用如何帮助代理人克服彼此的局限性。

关键词

引用

@article{arxiv.2410.11689,
  title  = {BlendRL: A Framework for Merging Symbolic and Neural Policy Learning},
  author = {Hikaru Shindo and Quentin Delfosse and Devendra Singh Dhami and Kristian Kersting},
  journal= {arXiv preprint arXiv:2410.11689},
  year   = {2025}
}

备注

ICLR 2025 (Spotlight)