一般函数逼近下强化学习中的模型选择
机器学习
2022-07-08 v1 信息论
机器学习
math.IT
摘要
我们考虑在一般函数逼近下,经典强化学习(RL)环境——多臂赌博机(MABs)和马尔可夫决策过程(MDPs)——中的模型选择问题。在模型选择框架中,我们不知道真实的模型——MABs 的奖励生成函数和 MDPs 的转移核——分别所在的函数类,记为 和 。相反,我们被给予 个嵌套的函数(假设)类,使得真实模型至少包含在其中一个类中。在本文中,我们提出并分析了针对 MABs 和 MDPs 的高效模型选择算法,这些算法能够\emph{自适应}于包含真实底层模型的最小函数类(在嵌套的 个类中)。在嵌套假设类的可分离性假设下,我们证明了自适应算法的累积遗憾与预先知道正确函数类(即 和 )的预言机(oracle)的遗憾相匹配。此外,对于这两种设置,我们都表明模型选择的代价是遗憾中的一个加性项,对学习时长 具有弱(对数)依赖性。
引用
@article{arxiv.2207.02992,
title = {Model Selection in Reinforcement Learning with General Function Approximations},
author = {Avishek Ghosh and Sayak Ray Chowdhury},
journal= {arXiv preprint arXiv:2207.02992},
year = {2022}
}
备注
To appear in ECML-PKDD 2022. arXiv admin note: substantial text overlap with arXiv:2107.05849