通过自举机会式课程实现的鲁棒深度强化学习
机器学习
2023-01-11 v2
摘要
尽管深度强化学习取得了显著进展,但已被证明其对状态观测的对抗扰动高度脆弱。近期试图提升强化学习对抗鲁棒性的努力仅能容忍极小的扰动,并随着扰动幅度增大仍保持脆弱。我们提出自举机会式对抗课程学习(BCL),一种用于鲁棒强化学习的新型灵活对抗课程学习框架。我们的框架结合两个思路:以保守方式用前一阶段多次运行获得的最高质量解自举每个课程阶段,以及机会式向前跳过课程。在实验中,我们表明所提出的 BCL 框架使学习策略对对抗扰动的鲁棒性得到显著提升。最大提升见于 Pong,我们的框架对高达 25/255 的扰动具有鲁棒性;相比之下,现有最佳方法仅能容忍至多 5/255 的对抗噪声。我们的代码见:https://github.com/jlwu002/BCL。
引用
@article{arxiv.2206.10057,
title = {Robust Deep Reinforcement Learning through Bootstrapped Opportunistic Curriculum},
author = {Junlin Wu and Yevgeniy Vorobeychik},
journal= {arXiv preprint arXiv:2206.10057},
year = {2023}
}
备注
ICML 2022