中文

在赌博机与带生成模型的强化学习中使用良好特征表示的学习

机器学习 2020-02-20 v2 机器学习

摘要

Du 等人 (2019) 的构造表明,即使给学习者提供了 Rd\mathbb R^d 中的线性特征,这些特征以 ϵ\epsilon 的一致误差逼近赌博机中的奖励,寻找一个最优性在 O(ϵ)O(\epsilon) 以内的动作仍需检查几乎所有动作。我们利用 Kiefer-Wolfowitz 定理证明了一个正面结果:通过仅检查少数动作,学习者总能找到一个次优性误差至多为 O(ϵd)O(\epsilon \sqrt{d}) 的动作。因此,当逼近误差相对于特征的维数较小时,特征是有效的。该思想被应用于随机赌博机与带生成模型的强化学习,其中学习者可访问 dd 维线性特征,这些特征以 ϵ\epsilon 的精度逼近所有策略的动作值函数。对于线性赌博机,我们证明了关于后悔值的界为 dnlog(k)+ϵndlog(n)\sqrt{dn \log(k)} + \epsilon n \sqrt{d} \log(n),其中 kk 为动作数,nn 为时间范围。对于强化学习,我们展示了近似策略迭代能够学到最优性在加性误差 O(ϵd/(1γ)2)O(\epsilon \sqrt{d}/(1 - \gamma)^2) 以内的策略,并使用来自生成模型的 d/(ϵ2(1γ)4)d/(\epsilon^2(1 - \gamma)^4) 个样本。这些界独立于特征的更精细细节。我们还研究了特征集的结构如何影响样本复杂度与估计误差之间的权衡。

关键词

引用

@article{arxiv.1911.07676,
  title  = {Learning with Good Feature Representations in Bandits and in RL with a Generative Model},
  author = {Tor Lattimore and Csaba Szepesvari and Gellert Weisz},
  journal= {arXiv preprint arXiv:1911.07676},
  year   = {2020}
}

备注

13 pages