结合悲观与乐观的鲁棒高效基于模型的深度强化学习
机器学习
2021-03-19 v1 人工智能
机器学习
摘要
在真实世界任务中,强化学习(RL)智能体频繁遇到训练时未出现的情况。为确保可靠性能,RL 智能体需要对最坏情况表现出鲁棒性。鲁棒 RL 框架通过智能体与被 adversary(对手)之间的最坏情况优化来解决这一挑战。先前的鲁棒 RL 算法要么样本效率低,缺乏鲁棒性保证,要么无法扩展到大型问题。我们提出鲁棒幻觉上置信 RL(RH-UCRL)算法,可证明地解决该问题,同时获得近最优的样本复杂度保证。RH-UCRL 是一种基于模型的强化学习(MBRL)算法,有效区分认知不确定性和偶然不确定性,并在策略学习过程中高效探索智能体和对手的决策空间。我们通过神经网络集成模型以及神经网络策略将 RH-UCRL 扩展到复杂任务。在实验上,我们证明 RH-UCRL 在各种对抗环境中优于其他鲁棒深度 RL 算法。
引用
@article{arxiv.2103.10369,
title = {Combining Pessimism with Optimism for Robust and Efficient Model-Based Deep Reinforcement Learning},
author = {Sebastian Curi and Ilija Bogunovic and Andreas Krause},
journal= {arXiv preprint arXiv:2103.10369},
year = {2021}
}