安全的原语强化学习
偏微分方程分析
2025-10-17 v2
摘要
原语强化学习(ICRL)是一种新兴的RL范式,其中在预训练后,智能体无需进行参数更新,而是依赖于交互历史的扩展上下文来适应分布外测试任务。尽管ICRL在方面展示了惊人的泛化能力,但在适应过程中的安全性尚未得到探讨,限制了其在实际部署中应用,其中测试时的行为预期是安全的。在本文中,我们提出了SCARED:Safe Contextual Adaptive Reinforcement via Exact-penalty Dual,这是首个在受约束马尔可夫决策过程框架下促进ICRL安全适应的方法。在参数更新自由的适应过程中,我们的智能体不仅最大化奖励,还保持累积成本在用户指定的安全预算内。我们还展示,智能体会主动响应安全预算;在更高的安全预算下,智能体行为更激进;在更低的安全预算下,智能体行为更保守。在具有挑战性的基准测试中,SCARED始终能够实现安全且稳健的原语适应,超越现有的ICRL和安全元强化学习基线。
关键词
引用
@article{arxiv.2509.25581,
title = {Nonlocal critical problems with mixed boundary conditions and nearly resonant perturbations},
author = {Eduardo Colorado and Giovanni Monica Bisci and Alejandro Ortega and Luca Vilasi},
journal= {arXiv preprint arXiv:2509.25581},
year = {2025}
}
备注
18 pages