中文

强化学习的临界性与安全裕度

机器学习 2025-05-29 v2 人工智能 系统与控制 系统与控制

摘要

最先进的强化学习方法有时会遇到不安全的情况。识别这些情况何时发生对事后分析和部署期间(可能需要呼叫人类监督者获取帮助)都很感兴趣。用于衡量不同时间点临界性的努力已开发,但由于缺乏真实答案,其准确性未得到良好 establishe,而且它们不旨在轻松地可被最终用户解释。因此,我们致力于定义一个具有可量化真实答案和清晰意义的临界性框架。我们引入了真实临界性,即当代理器偏离其策略连续执行 n 次随机动作时奖励下降的期望值。我们还引入了代理临界性的概念,这是一种低开销指标,与真实临界性具有统计单调关系。安全裕度使得这些指标可被解释,定义为在高置信度下,性能损失不会超过某些容忍值的随机动作次数。我们在多个环境-代理器组合中展示了这一方法;对于在 Atari Beamrider 环境中使用 A3C 代理器的最低 5% 安全裕度包含 47% 的代理器损失;即仅监督 5% 的决策即可潜在地防止约半的代理器错误。该临界性框架衡量坏决策的潜在影响,甚至在这些决策做出之前也能实现更有效的调试和自主代理器监督。

关键词

引用

@article{arxiv.2409.18289,
  title  = {Criticality and Safety Margins for Reinforcement Learning},
  author = {Alexander Grushin and Walt Woods and Alvaro Velasquez and Simon Khan},
  journal= {arXiv preprint arXiv:2409.18289},
  year   = {2025}
}

备注

17 pages, 10 figures