通用强化学习的模型选择
机器学习
2021-12-13 v2 信息论
机器学习
math.IT
摘要
我们研究有限时域片段式强化学习(RL)问题的模型选择,其中转移核 属于具有有限度量熵的模型族 。在模型选择框架中,我们给定的不是 ,而是 个嵌套的转移核族 。我们提出并分析了一种新颖算法,即自适应强化学习(通用)(\texttt{ARL-GEN}),它自适应于真实转移核 所处的最小此类族。\texttt{ARL-GEN} 将具有值定向回归的上置信强化学习(\texttt{UCRL})算法作为黑盒使用,并在每个时段开始时放置一个模型选择模块。在对模型类作温和可分离假设下,我们证明 \texttt{ARL-GEN} 以高概率获得 的遗憾值,其中 为时域长度, 为总步数, 为 Eluder 维数, 为对应于 的度量熵。注意该遗憾缩放与提前知晓 的预言机相同。我们表明 \texttt{ARL-GEN} 的模型选择代价是遗憾中的一个加性项,对 的依赖较弱。随后,我们去除可分离假设并考虑线性混合 MDP 的设置,其中转移核 具有线性函数逼近。利用该低秩结构,我们提出了用于模型选择的新颖自适应算法,并获得了(在阶上)与知晓真实模型类的预言机相同的遗憾值。
引用
@article{arxiv.2107.05849,
title = {Model Selection for Generic Reinforcement Learning},
author = {Avishek Ghosh and Sayak Ray Chowdhury and Kannan Ramchandran},
journal= {arXiv preprint arXiv:2107.05849},
year = {2021}
}