具有线性函数逼近的无奖励基于模型的强化学习
计算与语言
2021-10-14 v1 信息检索
摘要
我们研究具有线性函数逼近的基于模型的无奖励强化学习,针对情节式马尔可夫决策过程(MDPs)。在该设定下,智能体分两个阶段工作。在探索阶段,智能体与环境交互并收集样本而不获取奖励。在规划阶段,智能体被给定特定的奖励函数,并利用探索阶段收集的样本来学习一个好的策略。我们提出一种可证明高效的新型算法,称为UCRL-RFE,基于线性混合MDP假设,其中MDP的转移概率核可由定义在状态、动作和下一状态三元组上的特定特征映射的线性函数参数化。我们表明,要获得任意奖励函数的-最优策略,UCRL-RFE在探索阶段至多需要采样个情节。这里,是情节长度,是特征映射的维度。我们还提出了一种使用Bernstein型奖励的UCRL-RFE变体,并表明它至多需要采样以达到-最优策略。通过构造一类特殊的线性混合MDP,我们还证明了对于任何无奖励算法,它需要至少采样个情节来获得-最优策略。我们的上界在关于的依赖以及当时关于的依赖上与下界匹配。
引用
@article{arxiv.2110.06393,
title = {Attention-guided Generative Models for Extractive Question Answering},
author = {Peng Xu and Davis Liang and Zhiheng Huang and Bing Xiang},
journal= {arXiv preprint arXiv:2110.06393},
year = {2021}
}
备注
10 pages