中文

通用强化学习的模型选择

机器学习 2021-12-13 v2 信息论 机器学习 math.IT

摘要

我们研究有限时域片段式强化学习(RL)问题的模型选择,其中转移核 PP^* 属于具有有限度量熵的模型族 P\mathcal{P}^*。在模型选择框架中,我们给定的不是 P\mathcal{P}^*,而是 MM 个嵌套的转移核族 \cP1\cP2\cPM\cP_1 \subset \cP_2 \subset \ldots \subset \cP_M。我们提出并分析了一种新颖算法,即自适应强化学习(通用)(\texttt{ARL-GEN}),它自适应于真实转移核 PP^* 所处的最小此类族。\texttt{ARL-GEN} 将具有值定向回归的上置信强化学习(\texttt{UCRL})算法作为黑盒使用,并在每个时段开始时放置一个模型选择模块。在对模型类作温和可分离假设下,我们证明 \texttt{ARL-GEN} 以高概率获得 \TildeO(dEH2+dEMH2T)\Tilde{\mathcal{O}}(d_{\mathcal{E}}^*H^2+\sqrt{d_{\mathcal{E}}^* \mathbb{M}^* H^2 T}) 的遗憾值,其中 HH 为时域长度,TT 为总步数,dEd_{\mathcal{E}}^* 为 Eluder 维数,M\mathbb{M}^* 为对应于 P\mathcal{P}^* 的度量熵。注意该遗憾缩放与提前知晓 P\mathcal{P}^* 的预言机相同。我们表明 \texttt{ARL-GEN} 的模型选择代价是遗憾中的一个加性项,对 TT 的依赖较弱。随后,我们去除可分离假设并考虑线性混合 MDP 的设置,其中转移核 PP^* 具有线性函数逼近。利用该低秩结构,我们提出了用于模型选择的新颖自适应算法,并获得了(在阶上)与知晓真实模型类的预言机相同的遗憾值。

关键词

引用

@article{arxiv.2107.05849,
  title  = {Model Selection for Generic Reinforcement Learning},
  author = {Avishek Ghosh and Sayak Ray Chowdhury and Kannan Ramchandran},
  journal= {arXiv preprint arXiv:2107.05849},
  year   = {2021}
}