样本高效的神经符号近端策略优化
人工智能
2026-04-29 v1
摘要
深度强化学习(DRL)算法通常需要大量数据,并在具有长规划视界和多个子目标的稀疏奖励领域中面临困难。在本文中,我们提出了近端策略优化(PPO)的神经符号扩展,将在较简单实例中学习到的部分逻辑策略规范转移到更具挑战性的环境中以指导学习。我们引入了两种符号指导的集成:(i)H-PPO-Product,在采样时偏置动作分布;(ii)H-PPO-SymLoss,用符号正则化项增强PPO损失。我们在三个基准(OfficeWorld、WaterWorld和DoorKey)上评估了我们的方法,表明在收敛时学习速度更快且回报更高,优于PPO和奖励机基线,且在不完美的符号知识下同样如此。
引用
@article{arxiv.2604.25534,
title = {Sample-efficient Neuro-symbolic Proximal Policy Optimization},
author = {Simone Murari and Celeste Veronese and Daniele Meli},
journal= {arXiv preprint arXiv:2604.25534},
year = {2026}
}