中文

面向安全与模型无关强化学习的渐进式保障机制

机器学习 2024-11-01 v1 计算机科学中的逻辑

摘要

本文提出了一种正式的、模型无关的元学习框架,用于安全强化学习。我们的框架灵感来源于父母如何在日益风险递增的任务序列中保护子女,将一种安全性意识从一个任务传递到下一个任务。我们将其建模为一个元学习过程,其中每个任务都与一个保障机制同步,该机制监控安全性并为智能体提供奖励信号。保障机制基于安全规范实现为有限状态机;奖励信号围绕该规范进行正式塑造。安全规范及其对应的保障机制可以任意复杂且非马尔可夫,这为训练过程增加了灵活性并为所学策略增加了可解释性。保障机制的设计是手动的,但它是高层且模型无关的,从而产生了一种端到端的安全学习方法,具有广泛的适用性,从像素级游戏控制到语言模型微调。从一组给定的安全规范(任务)出发,我们训练一个模型,使其能够仅使用少量训练样本适应新的规范。这得益于我们提出的在任务之间高效迁移安全偏差的有效方法,该方法能够最小化安全违规次数。我们在受 Minecraft 启发的 Gridworld、VizDoom 游戏环境和 LLM 微调应用中评估了我们的框架。使用我们方法训练的智能体实现了接近最小的安全违规,而基线方法表现不佳。

关键词

引用

@article{arxiv.2410.24096,
  title  = {Progressive Safeguards for Safe and Model-Agnostic Reinforcement Learning},
  author = {Nabil Omi and Hosein Hasanbeig and Hiteshi Sharma and Sriram K. Rajamani and Siddhartha Sen},
  journal= {arXiv preprint arXiv:2410.24096},
  year   = {2024}
}