中文

用于安全 in-context 强化学习的潜在 Q-Barrier 防护

机器学习 2026-05-26 v1 人工智能

摘要

安全 in-context 强化学习 (ICRL) 在不进行测试时参数更新的情况下从交互历史中自适应,以控制 episode cost 在安全预算下的控制。 在外分布部署偏移下,仅基于预训练的安全 ICRL 可能在奖励-安全权衡方面表现不佳,因为剩余预算仅通过冻结策略条件化影响行为,而非通过对预测未来成本的显式动作级检查来影响。 我们提出一种潜在 Q-Barrier 防护方案,该方案在部署前学习上下文表示、潜在动态以及一套成本 critic。 在不进行参数更新的情况下,防护推断上下文并使用剩余预算和预测的未来成本过滤或软重排序候选动作。 我们证明了一个条件化、误差分解的 barrier-margin 结果:满足 Q-Barrier 满足条件的动作在学习的 critic 下,留给下一个潜在-预算状态的 approximately budget-safe continuation,最多受 Bellman 误差和潜在预测误差的影响。在五个安全 ICRL 基准测试中,该防护在强大的安全 ICRL 基准之上改进了部署时的奖励-安全权衡:在短暂的上下文窗口之后,它在四个五个基准测试中实现更高的回报,同时在所有五个基准测试中匹配或降低平均 episode 成本。

关键词

引用

@article{arxiv.2605.25267,
  title  = {Latent Q-Barrier Shielding for Safe In-Context Reinforcement Learning},
  author = {Minjae Kwon and Amir Moeini and Shangtong Zhang and Lu Feng},
  journal= {arXiv preprint arXiv:2605.25267},
  year   = {2026}
}