中文

通过 $l_\infty$ Lipschitz 策略网络提升强化学习对观测扰动的鲁棒性

机器学习 2023-12-15 v1

摘要

深度强化学习 (DRL) 在序列决策任务中取得了显著进展。然而,最近的研究表明,DRL 智能体容易受到观测中轻微扰动的影响。这种脆弱性引发了人们对在现实世界应用中部署此类智能体的有效性和鲁棒性的担忧。在这项工作中,我们提出了一种名为 SortRL 的全新鲁棒强化学习方法,该方法从网络架构的角度提升了 DRL 策略对观测扰动的鲁棒性。我们为策略网络采用了一种结合全局 ll_\infty Lipschitz 连续性的全新架构,并提供了一种基于输出边界的简便方法来增强策略鲁棒性。此外,我们为 SortRL 设计了训练框架,在解决给定任务的同时,保持对观测上 ll_\infty 有界扰动的鲁棒性。我们进行了多项实验来评估该方法的有效性,包括经典控制任务和电子游戏。结果表明,SortRL 在面对不同扰动强度时实现了 SOTA 的鲁棒性表现。

关键词

引用

@article{arxiv.2312.08751,
  title  = {Improve Robustness of Reinforcement Learning against Observation Perturbations via $l_\infty$ Lipschitz Policy Networks},
  author = {Buqing Nie and Jingtian Ji and Yangqing Fu and Yue Gao},
  journal= {arXiv preprint arXiv:2312.08751},
  year   = {2023}
}

备注

Accepted paper on AAAI2024