中文

面向对抗性破坏的鲁棒基于模型的强化学习

机器学习 2024-07-23 v3 机器学习

摘要

本研究应对基于模型的强化学习(RL)中对抗性破坏的挑战,其中转移动态可能被对手破坏。关于破坏鲁棒 RL 的现有研究主要集中在无模型 RL 的设置上,其中通常采用鲁棒最小二乘回归进行价值函数估计。然而,这些技术不能直接应用于基于模型的 RL。在本文中,我们专注于基于模型的 RL,并采用最大似然估计(MLE)方法来学习转移模型。我们的工作涵盖在线和离线设置。在在线设置中,我们引入了一种称为破坏鲁棒乐观 MLE(CR-OMLE)的算法,该算法利用基于总变差(TV)的信息比率作为 MLE 的不确定性权重。我们证明 CR-OMLE 实现了 O~(T+C)\tilde{\mathcal{O}}(\sqrt{T} + C) 的遗憾,其中 CC 表示 TT 个回合后的累积破坏水平。我们还证明了一个下界,以表明对 CC 的加性依赖是最优的。我们将我们的加权技术扩展到离线设置,并提出了一种名为破坏鲁棒悲观 MLE(CR-PMLE)的算法。在均匀覆盖条件下,CR-PMLE 表现出恶化了 O(C/n)\mathcal{O}(C/n) 的次优性,几乎匹配下界。据我们所知,这是第一个关于具有可证明保证的破坏鲁棒基于模型的 RL 算法的工作。

关键词

引用

@article{arxiv.2402.08991,
  title  = {Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption},
  author = {Chenlu Ye and Jiafan He and Quanquan Gu and Tong Zhang},
  journal= {arXiv preprint arXiv:2402.08991},
  year   = {2024}
}