中文

具有一般函数逼近的腐败鲁棒离线强化学习

机器学习 2024-02-20 v3

摘要

我们研究具有一般函数逼近的离线强化学习(RL)中的腐败鲁棒性问题,其中 adversary 可破坏离线数据集中的每个样本,且腐败水平 ζ0\zeta\geq0 量化了 nn 个回合与 HH 步上的累积腐败量。我们的目标是找到对 such 腐败鲁棒且相对于未受破坏的马尔可夫决策过程(MDPs)中最优策略的次优性差距最小化的策略。受鲁棒在线 RL 设定中不确定性加权技术的启发 \citep{he2022nearly,ye2022corruptionrobust},我们设计了一种新的不确定性权重迭代过程以在批处理样本上高效计算,并提出了一种面向离线 RL 的腐败鲁棒算法。值得注意的是,在单策略覆盖假设与已知 ζ\zeta 下,我们提出的算法取得的次优性界因腐败而恶化了附加因子 O(ζ(C(F^,μ)n)1)\mathcal{O}(\zeta (C(\widehat{\mathcal{F}},\mu)n)^{-1})。此处 F^\widehat{\mathcal{F}} 为置信集,数据集为 ZnH\mathcal{Z}_n^HC(F^,μ)C(\widehat{\mathcal{F}},\mu) 为依赖于 F^\widehat{\mathcal{F}} 与底层数据分布 μ\mu 的系数。当特化至线性 MDP 时,该依赖于腐败的误差项降为 O(ζdn1)\mathcal{O}(\zeta d n^{-1}),其中 dd 为特征映射的维度,这与已有的受 corruption 线性 MDP 下界相匹配。这表明我们的分析在依赖于腐败的项上是紧的。

关键词

引用

@article{arxiv.2310.14550,
  title  = {Corruption-Robust Offline Reinforcement Learning with General Function Approximation},
  author = {Chenlu Ye and Rui Yang and Quanquan Gu and Tong Zhang},
  journal= {arXiv preprint arXiv:2310.14550},
  year   = {2024}
}