可行区与不确定模型之间平衡的安全探索
机器学习
2026-02-05 v2 系统与控制
系统与控制
摘要
确保环境探索的安全性是强化学习(RL)中的一个关键问题。虽然将探索限制在可行区已被广泛接受为确保安全的方式,但仍有若干关键问题尚未解决:通过探索可实现的最大可行区是多少,如何识别其边界?本文首次回答这些问题,通过揭示安全探索的目标在于找到可行区与环境模型之间的平衡。这一结论基于这样一种理解:这两个组成部分是相互关联的——可行区越大,环境模型就越准确;而更准确的模型反过来又能促进探索更大的区域。我们提出了首个以平衡为导向的安全探索框架,称为安全平衡探索(SEE),该框架在寻找最大可行区和最小不确定模型之间交替进行。通过对不确定模型进行图形化表述,我们证明了SEE获得的不确定模型单调改进,可行区单调扩大,且二者收敛于安全探索的平衡。在经典控制任务上的实验表明,我们的算法在零约束违反的情况下成功扩大了可行区,并在少数迭代次数内实现了安全探索的平衡。
引用
@article{arxiv.2602.00636,
title = {On the Equilibrium between Feasible Zone and Uncertain Model in Safe Exploration},
author = {Yujie Yang and Zhilong Zheng and Shengbo Eben Li},
journal= {arXiv preprint arXiv:2602.00636},
year = {2026}
}