针对强数据损坏的鲁棒策略梯度
机器学习
2021-06-09 v3
摘要
我们研究在奖励和状态转移均受对抗性损坏情况下的鲁棒强化学习问题。我们的攻击模型假设一个自适应对手可在每一回合内于每一步任意损坏奖励和转移,但最多影响 比例的训练回合。我们的攻击模型严格强于先前工作所考虑的模型。我们的第一个结果表明,在该攻击模型下,任何算法都无法找到优于 -最优的策略。接下来,我们表明令人惊讶的是,若奖励损坏有界,自然策略梯度 (NPG) 方法保留了一种天然的鲁棒性性质,并能找到 -最优的策略。据此,我们开发了滤波策略梯度 (FPG) 算法,其甚至可容忍无界奖励损坏,并能找到 -最优的策略。我们强调,FPG 是首个在常数比例回合被损坏时仍能提供有意义学习保证的算法。作为理论结果的补充,我们展示了 FPG 的神经网络实现在 MuJoCo 连续控制基准上取得了强鲁棒学习性能。
引用
@article{arxiv.2102.05800,
title = {Robust Policy Gradient against Strong Data Corruption},
author = {Xuezhou Zhang and Yiding Chen and Xiaojin Zhu and Wen Sun},
journal= {arXiv preprint arXiv:2102.05800},
year = {2021}
}