基于自适应安全约束的非平稳安全持续强化学习
机器学习
2026-05-20 v1
摘要
在非平稳环境中进行安全强化学习需要能够随环境条件变化而自适应的安全机制。标准的安全强化学习方法常假设约束固定或环境稳定,这在分布迁移下往往不够。我们提出了 LILAC+(Learning with Integrated Adaptive Constraints),一种在非平稳情境下进行安全持续强化学习的框架,融合了三种自适应安全机制:基于情境的安全约束、适应速度约束、以及预算到状态的安全执行。基于情境的约束通过推断与预测的环境情境调整安全要求;适应速度约束在代理适应安全能力之前的环境变化速率超出阈值时紧固安全要求;预算到状态执行将累积安全要求转化为可在决策时强制执行的局部状态级控制约束。这些机制共同提供了一种用于持续强化学习中主动与被动安全自适应的统一方法。我们在模拟驾驶环境中评估了该框架,分别在稳态、已知非平稳及未知非平稳情境下测试。结果表明,在分布迁移下,自适应安全约束显著降低了安全违规,同时在无约束及固定约束基准中保持了具竞争力的任务性能。我们的发现表明,安全持续强化学习需要能够响应当前状态信息、预测环境情境、适应需求以及剩余安全预算的自适应约束机制。
引用
@article{arxiv.2605.18842,
title = {Safe Continual Reinforcement Learning under Nonstationarity via Adaptive Safety Constraints},
author = {Timofey Tomashevskiy},
journal= {arXiv preprint arXiv:2605.18842},
year = {2026}
}
备注
Preprint version