中文

约束强化学习中控制低估偏差以实现安全探索

机器学习 2026-01-21 v1

摘要

约束强化学习(CRL)旨在最大化累积奖励的同时满足约束条件。然而,现有的 CRL 算法在训练过程中经常出现严重的约束违反,限制了其在安全关键场景中的应用。在本文中,我们识别出代价价值函数的低估是导致这些违反的关键因素。为解决此问题,我们提出了记忆驱动的内在代价估计(MICE)方法,该方法引入内在代价以缓解低估并控制偏差,从而促进更安全的探索。受闪光灯记忆(人类通过生动回忆危险经历来规避风险)的启发,MICE 构建了一个记忆模块,用于存储先前探索过的不安全状态,以识别高代价区域。内在代价被定义为当前状态访问这些风险区域的伪计数。此外,我们提出了一种融合内在代价并采用偏差校正策略的外在-内在代价价值函数。利用该函数,我们在信赖域内构建了一个优化目标,并给出了相应的优化方法。理论上,我们为所提出的代价价值函数提供了收敛性保证,并建立了 MICE 更新的最坏情况约束违反界限。大量实验表明,MICE 在显著减少约束违反的同时,保持了与基线方法相当的性能。

关键词

引用

@article{arxiv.2601.11953,
  title  = {Controlling Underestimation Bias in Constrained Reinforcement Learning for Safe Exploration},
  author = {Shiqing Gao and Jiaxin Ding and Luoyi Fu and Xinbing Wang},
  journal= {arXiv preprint arXiv:2601.11953},
  year   = {2026}
}

备注

Published in the 42nd International Conference on Machine Learning (ICML 2025, Oral)