中文

具有线性函数逼近的无限 horizon 离线强化学习:维度灾难与算法

机器学习 2021-03-19 v1 人工智能 最优化与控制 机器学习

摘要

在本文中,我们研究了具有线性函数逼近的无限 horizon 离线强化学习(也称为离屏策略评估问题)中策略评估的样本复杂度。我们确定了一个困难区间 dγ^2>1,其中 d 是特征向量的维度,γ 是折扣率。在该区间内,对任意 q∈[γ^2,1],我们可构造一个困难实例,其特征协方差矩阵的最小特征值为 q/d,且需要 Ω((d/(γ^2(q−γ^2)ε^2)) exp(Θ(dγ^2))) 个样本以将值函数逼近到加性误差 ε。注意样本复杂度的下界关于 d 是指数级的。若 q=γ^2,即使无限数据也不够。在低分布偏移假设下,我们证明存在一个算法,其至多需要 O(max{ (‖θ^π‖_2^4/ε^4) log(d/δ), (1/ε^2)(d+log(1/δ)) }) 个样本(θ^π 是线性函数逼近中策略的参数),并以至少 1−δ 的概率保证将值函数逼近到加性误差 ε。

关键词

引用

@article{arxiv.2103.09847,
  title  = {Infinite-Horizon Offline Reinforcement Learning with Linear Function Approximation: Curse of Dimensionality and Algorithm},
  author = {Lin Chen and Bruno Scherrer and Peter L. Bartlett},
  journal= {arXiv preprint arXiv:2103.09847},
  year   = {2021}
}