学习通用策略的策略梯度方法
人工智能
2025-12-23 v1 机器学习
摘要
虽然强化学习方法在诸多场景中取得了显著成果,但泛化能力——即可靠且系统性地产生可泛化策略的能力——仍然是一个挑战。经典规划中已形式化地解决了该问题,可通过组合方法学习出在给定域的所有实例上均可保证正确的策略。本文旨在将这两个研究线程结合起来,阐明深度强化学习方法,特别是策略优化方法,在何种条件下可用于学习像组合方法那样具有泛化能力的策略。我们借鉴并扩展了以往的组合和深度学习方法。前者表明,策略可被建模为状态转换分类器,因为(具体)动作并非通用且随实例不同而变化。后者则使用适用于处理关系结构的图神经网络(GNN),用于表示规划状态上的价值函数,亦即本文中的策略。凭借这些构件,我们发现,演员-评论家方法可用于学习几乎像组合方法那样具有泛化能力的策略,同时避免了规模瓶颈和特征池的使用。此外,本文所考察基准上DRL方法的局限性与深度学习或强化学习算法关系不大,结果源于GNN已被充分理解的表达性局限,以及最优性与泛化之间的tradeoff(通用策略在某些域中无法达到最优)。这两个局限性通过添加派生谓词和替代成本结构而无需改变基本DRL方法的方式得到缓解。
引用
@article{arxiv.2512.19366,
title = {Learning General Policies with Policy Gradient Methods},
author = {Simon Ståhlberg and Blai Bonet and Hector Geffner},
journal= {arXiv preprint arXiv:2512.19366},
year = {2025}
}
备注
In Proceedings of the 20th International Conference on Principles of Knowledge Representation and Reasoning (KR 2023)