中文

基于自适应盾牌的黑盒环境安全强化学习

人工智能 2025-08-27 v3 机器学习

摘要

在许多真实场景中, Empowering safe exploration of reinforcement learning (RL) agents during training 是实现其部署的关键挑战。当缺乏对领域或任务的先验知识时,在未知的黑盒环境中训练 RL 智能体会带来更大的安全风险。我们引入了 ADVICE(Adaptive Shielding with a Contrastive Autoencoder),这是一种 novel post-shielding 技术,通过区分训练期间安全与不安全的状态-动作对,利用此知识保护 RL 智能体免于执行可能导致危险结果的动作。我们对抗 state-of-the-art safe RL exploration 技术进行了全面实验评估,结果表明 ADVICE 在训练期间显著减少约 50% 的安全违规,同时保持与其他技术相当的回报。

关键词

引用

@article{arxiv.2405.18180,
  title  = {Safe Reinforcement Learning in Black-Box Environments via Adaptive Shielding},
  author = {Daniel Bethell and Simos Gerasimou and Radu Calinescu and Calum Imrie},
  journal= {arXiv preprint arXiv:2405.18180},
  year   = {2025}
}

备注

To be published in ECAI 25