中文

抗 corrupted 的离线强化学习

机器学习 2021-06-15 v1

摘要

我们研究离线强化学习中的对抗鲁棒性。给定一个由元组 (s,a,r,s)(s, a, r, s') 组成的批量数据集,允许 adversary 任意修改其中 ϵ\epsilon 比例的元组。从被污染的数据集中,学习者的目标是鲁棒地识别一个近最优策略。我们首先证明,在维度为 dd 的线性 MDP 中,即使 adversary 仅修改元组中的奖励元素,也无法避免最坏情况下 Ω(dϵ)\Omega(d\epsilon) 的最优性差距。这与鲁棒监督学习中的维度无关结果以及已知的带污染在线 RL 设置中的最佳下界形成对比。接下来,我们提出了利用鲁棒监督学习 oracle 的最小二乘值迭代(LSVI)算法的鲁棒变体,在具有和不具有完全数据覆盖的情况下均取得了近乎匹配的性能。该算法需要知道 ϵ\epsilon 以在无覆盖情况下设计悲观奖励(pessimism bonus)。令人惊讶的是,在这种情况下,ϵ\epsilon 的知识是必要的,因为我们表明自适应于未知 ϵ\epsilon 是不可能的。这再次与近期关于抗污染在线 RL 的结果形成对比,并意味着鲁棒离线 RL 是一个严格更难的问题。

关键词

引用

@article{arxiv.2106.06630,
  title  = {Corruption-Robust Offline Reinforcement Learning},
  author = {Xuezhou Zhang and Yiding Chen and Jerry Zhu and Wen Sun},
  journal= {arXiv preprint arXiv:2106.06630},
  year   = {2021}
}