高效的神经符号深度强化学习
人工智能
2026-04-13 v2
摘要
强化学习(RL)是用于复杂环境中顺序决策的成熟框架。然而,最先进的深度强化学习(DRL)算法通常需要大量训练数据,并且往往难以在标准基准测试的规模较小的训练场景之外进行泛化。我们提出一种神经符号 DRL 方法,通过整合背景符号知识来提高样本效率并实现对更具挑战性、未见任务的泛化。将为简单域实例定义的部分策略(在这些实例上性能易于实现)作为有用的先验 transferred 给更复杂的设置,以加速学习并避免从头开始调优 DRL 参数。为此,部分策略被表示为逻辑规则,并通过在探索期间偏向动作分布和在利用期间对 Q 值进行比例缩放来指导训练过程。这种神经符号集成既提高了可解释性与可信度,又在稀疏奖励环境和具有长期规划范围的任务中加快收敛速度。我们在具有挑战性的网格世界变体上进行了实证验证,包括完全可观测和部分可观测两种设置。我们展示的成果在最先进的奖励机器基线之上。
引用
@article{arxiv.2601.02850,
title = {Sample-Efficient Neurosymbolic Deep Reinforcement Learning},
author = {Celeste Veronese and Alessandro Farinelli and Daniele Meli},
journal= {arXiv preprint arXiv:2601.02850},
year = {2026}
}