中文

关于非线性强化学习中无奖励探索的统计效率

机器学习 2022-10-25 v2 人工智能 机器学习

摘要

我们在一般非线性函数逼近下研究无奖励强化学习(RL),并在多种标准结构假设下建立了样本效率与困难性结果。在正向结果方面,我们提出了 RFOLIVE(Reward-Free OLIVE)算法,用于在最小结构假设下进行样本高效的无奖励探索,该设定涵盖了先前研究的线性 MDP(Jin et al., 2020b)、线性完备性(Zanette et al., 2020b)以及具有未知表示的低秩 MDP(Modi et al., 2021)。我们的分析表明,后两种设定先前所采用的探索性或可达性假设,对于无奖励探索在统计上并非必要。在负向结果方面,我们在底层特征未知且线性完备性假设下,给出了无奖励与有奖励探索的统计困难性结果,展示了低秩与线性完备性设定之间呈指数级分离。

关键词

引用

@article{arxiv.2206.10770,
  title  = {On the Statistical Efficiency of Reward-Free Exploration in Non-Linear RL},
  author = {Jinglin Chen and Aditya Modi and Akshay Krishnamurthy and Nan Jiang and Alekh Agarwal},
  journal= {arXiv preprint arXiv:2206.10770},
  year   = {2022}
}