关于具有线性函数近似的无奖励强化学习
机器学习
2020-06-22 v1 人工智能
最优化与控制
机器学习
摘要
无奖励强化学习(RL)是一种同时适用于批量 RL 设定以及存在多个感兴趣奖励函数设定的框架。在探索阶段,智能体不使用预先指定的奖励函数收集样本。探索阶段结束后,给定一个奖励函数,智能体利用探索阶段收集的样本计算近最优策略。Jin 等人 [2020] 表明,在表格设定下,智能体仅需收集多项式数量的样本(就状态数、动作数和规划时域而言)即可进行无奖励 RL。然而在实践中,状态和动作的数量可能很大,因此需要函数近似方案以实现泛化。本工作中,我们给出了具有线性函数近似的无奖励 RL 的正面和负面结果。我们给出了线性马尔可夫决策过程设定下无奖励 RL 的算法,其中转移和奖励均容许线性表示。我们算法的样本复杂度在特征维数和规划时域上均为多项式,且完全独立于状态和动作的数量。我们进一步给出了仅最优 函数容许线性表示设定下无奖励 RL 的指数下界。我们的结果意味着无奖励 RL 样本复杂度上若干有趣的指数分离。
引用
@article{arxiv.2006.11274,
title = {On Reward-Free Reinforcement Learning with Linear Function Approximation},
author = {Ruosong Wang and Simon S. Du and Lin F. Yang and Ruslan Salakhutdinov},
journal= {arXiv preprint arXiv:2006.11274},
year = {2020}
}