博弈论鲁棒强化学习处理时间耦合扰动
机器学习
2024-04-26 v3 人工智能
摘要
部署强化学习(RL)系统需要对不确定性与模型误设具有鲁棒性,然而先前的鲁棒 RL 方法通常仅研究跨时间独立引入的噪声。实际上,不确定性的来源通常是跨时间耦合的。我们正式引入时间耦合扰动,为现有鲁棒 RL 方法带来全新挑战。为应对该挑战,我们提出 GRAD,一种新颖的博弈论方法,将时间耦合鲁棒 RL 问题视为部分可观测双人零和博弈。通过在该博弈中寻找近似均衡,GRAD 针对时间耦合扰动优化通用鲁棒性。在连续控制任务上的实验表明,相较于先前方法,我们的方法在带时间耦合扰动与解耦扰动的设定下,针对不同攻击域上的各类攻击均实现了更高程度的鲁棒性。
引用
@article{arxiv.2307.12062,
title = {Game-Theoretic Robust Reinforcement Learning Handles Temporally-Coupled Perturbations},
author = {Yongyuan Liang and Yanchao Sun and Ruijie Zheng and Xiangyu Liu and Benjamin Eysenbach and Tuomas Sandholm and Furong Huang and Stephen McAleer},
journal= {arXiv preprint arXiv:2307.12062},
year = {2024}
}
备注
Accepted at The Twelfth International Conference on Learning Representations (ICLR 2024)