中文

强化学习的双重视角:用于施加策略约束

机器学习 2025-04-28 v2 人工智能 系统与控制 系统与控制

摘要

模型无监督强化学习方法缺乏对训练策略施加行为约束的内在机制。虽然存在某些扩展,但它们仅限于特定类型的约束,如基于额外奖励信号的值约束或访问密度约束。在本文中,我们统一了这些现有技术,借助经典优化和控制理论中的原始-对偶框架,将其用于价值型和演员-评论家强化学习方法。获得的对偶形式对于施加额外约束非常有用,因为揭示了此类对偶约束(或正则化项)与原始奖励修改之间的内在关系。此外,借助该框架,我们能够引入一些新型约束,允许对策略的动作密度或在连续状态和动作之间转换的成本施加限制。从调整后的原始-对偶优化问题中,衍生出一种实用算法,支持各种策略约束的组合,这些约束通过可训练的奖励修改在训练期间自动处理。我们详细考察并评估了提出的DualCRL方法,在两个可解释环境中进行不同(或组合)约束下的测试。结果凸显了该方法的有效性,该方法最终为系统设计者提供了一个多功能的策略约束工具箱。

关键词

引用

@article{arxiv.2404.16468,
  title  = {A Dual Perspective of Reinforcement Learning for Imposing Policy Constraints},
  author = {Bram De Cooman and Johan Suykens},
  journal= {arXiv preprint arXiv:2404.16468},
  year   = {2025}
}

备注

Accepted for publication in IEEE Transactions on Artificial Intelligence