面向风险怀疑的受限强化学习中的乐观探索
机器学习
2025-08-28 v2 人工智能
摘要
风险怀疑受限强化学习(RaCRL)旨在学习策略,以最小化由环境固有随机性引起的罕见灾难性约束违规的概率。在一般情况下,风险怀恐会导致对环境的保守探索,这通常会导致收敛到次优策略,无法充分最大化奖励,或在某些情况下,无法实现目标。本文提出一种基于探索的RaCRL方法,称为乐观风险怀恐演员-评论家(ORAC),通过最大化状态-动作奖励值函数的局部上置置界,同时最小化风险怀恐状态-动作成本值函数的局部下置置界来构建探索性策略。具体而言,在每一步中,如果成本值的权重超过安全约束值,则增加;反之则减少。这样,该策略被鼓励探索环境中不确定的区域,以发现高奖励状态,同时仍满足安全约束。我们的实验结果表明,ORAC方法可防止收敛到次优策略,并在各种连续控制任务(如Safety-Gymnasium和复杂的CityLearn建筑能源管理环境)中显著改善了奖励-成本权衡。
引用
@article{arxiv.2507.08793,
title = {Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning},
author = {James McCarthy and Radu Marinescu and Elizabeth Daly and Ivana Dusparic},
journal= {arXiv preprint arXiv:2507.08793},
year = {2025}
}