中文

具有线性函数逼近的无奖励基于模型的强化学习

计算与语言 2021-10-14 v1 信息检索

摘要

我们研究具有线性函数逼近的基于模型的无奖励强化学习,针对情节式马尔可夫决策过程(MDPs)。在该设定下,智能体分两个阶段工作。在探索阶段,智能体与环境交互并收集样本而不获取奖励。在规划阶段,智能体被给定特定的奖励函数,并利用探索阶段收集的样本来学习一个好的策略。我们提出一种可证明高效的新型算法,称为UCRL-RFE,基于线性混合MDP假设,其中MDP的转移概率核可由定义在状态、动作和下一状态三元组上的特定特征映射的线性函数参数化。我们表明,要获得任意奖励函数的ϵ\epsilon-最优策略,UCRL-RFE在探索阶段至多需要采样O~(H5d2ϵ2)\tilde{\mathcal{O}}(H^5d^2\epsilon^{-2})个情节。这里,HH是情节长度,dd是特征映射的维度。我们还提出了一种使用Bernstein型奖励的UCRL-RFE变体,并表明它至多需要采样O~(H4d(H+d)ϵ2)\tilde{\mathcal{O}}(H^4d(H + d)\epsilon^{-2})以达到ϵ\epsilon-最优策略。通过构造一类特殊的线性混合MDP,我们还证明了对于任何无奖励算法,它需要至少采样Ω~(H2dϵ2)\tilde \Omega(H^2d\epsilon^{-2})个情节来获得ϵ\epsilon-最优策略。我们的上界在关于ϵ\epsilon的依赖以及当HdH \ge d时关于dd的依赖上与下界匹配。

关键词

引用

@article{arxiv.2110.06393,
  title  = {Attention-guided Generative Models for Extractive Question Answering},
  author = {Peng Xu and Davis Liang and Zhiheng Huang and Bing Xiang},
  journal= {arXiv preprint arXiv:2110.06393},
  year   = {2021}
}

备注

10 pages