抗 corrupted 的离线强化学习
机器学习
2021-06-15 v1
摘要
我们研究离线强化学习中的对抗鲁棒性。给定一个由元组 组成的批量数据集,允许 adversary 任意修改其中 比例的元组。从被污染的数据集中,学习者的目标是鲁棒地识别一个近最优策略。我们首先证明,在维度为 的线性 MDP 中,即使 adversary 仅修改元组中的奖励元素,也无法避免最坏情况下 的最优性差距。这与鲁棒监督学习中的维度无关结果以及已知的带污染在线 RL 设置中的最佳下界形成对比。接下来,我们提出了利用鲁棒监督学习 oracle 的最小二乘值迭代(LSVI)算法的鲁棒变体,在具有和不具有完全数据覆盖的情况下均取得了近乎匹配的性能。该算法需要知道 以在无覆盖情况下设计悲观奖励(pessimism bonus)。令人惊讶的是,在这种情况下, 的知识是必要的,因为我们表明自适应于未知 是不可能的。这再次与近期关于抗污染在线 RL 的结果形成对比,并意味着鲁棒离线 RL 是一个严格更难的问题。
引用
@article{arxiv.2106.06630,
title = {Corruption-Robust Offline Reinforcement Learning},
author = {Xuezhou Zhang and Yiding Chen and Jerry Zhu and Wen Sun},
journal= {arXiv preprint arXiv:2106.06630},
year = {2021}
}