中文

观测扰动下安全强化学习的鲁棒性研究

机器学习 2023-03-03 v3 人工智能 机器人学

摘要

安全强化学习(RL)训练策略以在满足安全约束的同时最大化任务奖励。虽然先前工作关注性能最优性,我们发现许多安全 RL 问题的最优解对于精心设计的观测扰动并不鲁棒和安全。我们形式化地分析了在安全 RL 设定中设计有效观测对抗攻击者的独特性质。我们表明,标准 RL 任务的基线对抗攻击技术对于安全 RL 并非总是有效,并提出了两种新方法——一种最大化代价,另一种最大化奖励。一个有趣且反直觉的发现是,最大奖励攻击是强力的,因为它既能诱导不安全行为,又可通过维持奖励使攻击隐蔽。我们进一步提出了一种安全 RL 的鲁棒训练框架,并通过综合实验对其评估。本文为未来安全 RL 研究探究 RL 在观测攻击下的安全性与鲁棒性提供了先驱工作。代码见:\url{https://github.com/liuzuxin/safe-rl-robustness}

关键词

引用

@article{arxiv.2205.14691,
  title  = {On the Robustness of Safe Reinforcement Learning under Observational Perturbations},
  author = {Zuxin Liu and Zijian Guo and Zhepeng Cen and Huan Zhang and Jie Tan and Bo Li and Ding Zhao},
  journal= {arXiv preprint arXiv:2205.14691},
  year   = {2023}
}

备注

Published at the 11th International Conference on Learning Representations (ICLR 2023). 30 pages, 5 figures, 8 tables