中文

高效的神经符号深度强化学习

人工智能 2026-04-13 v2

摘要

强化学习(RL)是用于复杂环境中顺序决策的成熟框架。然而,最先进的深度强化学习(DRL)算法通常需要大量训练数据,并且往往难以在标准基准测试的规模较小的训练场景之外进行泛化。我们提出一种神经符号 DRL 方法,通过整合背景符号知识来提高样本效率并实现对更具挑战性、未见任务的泛化。将为简单域实例定义的部分策略(在这些实例上性能易于实现)作为有用的先验 transferred 给更复杂的设置,以加速学习并避免从头开始调优 DRL 参数。为此,部分策略被表示为逻辑规则,并通过在探索期间偏向动作分布和在利用期间对 Q 值进行比例缩放来指导训练过程。这种神经符号集成既提高了可解释性与可信度,又在稀疏奖励环境和具有长期规划范围的任务中加快收敛速度。我们在具有挑战性的网格世界变体上进行了实证验证,包括完全可观测和部分可观测两种设置。我们展示的成果在最先进的奖励机器基线之上。

关键词

引用

@article{arxiv.2601.02850,
  title  = {Sample-Efficient Neurosymbolic Deep Reinforcement Learning},
  author = {Celeste Veronese and Alessandro Farinelli and Daniele Meli},
  journal= {arXiv preprint arXiv:2601.02850},
  year   = {2026}
}