中文

离线强化学习中模型选择的预言不等式

机器学习 2022-11-04 v1 人工智能

摘要

在离线强化学习(RL)中,学习器利用先前的日志数据学习良好策略,而无需与环境交互。在实践中应用此类方法的一大挑战是缺乏兼具理论原则性与实用性的模型选择与评估工具。为此,我们研究带有值函数近似的离线 RL 中的模型选择问题。学习器获得一组嵌套的模型类序列以最小化平方 Bellman 误差,且必须从中选择以在模型类的近似误差与估计误差间取得平衡。我们提出了首个离线 RL 的模型选择算法,其在对数因子内实现极小极大速率最优的预言不等式。该算法 ModBE 以一组候选模型类与通用基础离线 RL 算法为输入。通过利用新颖的单边泛化检验逐步剔除模型类,ModBE 返回一种策略,其 regret 随极小完备模型类的复杂度而缩放。除理论保证外,它在概念上简单且计算高效,等价于求解一系列平方损失回归问题并比较类间相对平方损失。我们以若干数值模拟作结,表明其能可靠地选择良好模型类。

关键词

引用

@article{arxiv.2211.02016,
  title  = {Oracle Inequalities for Model Selection in Offline Reinforcement Learning},
  author = {Jonathan N. Lee and George Tucker and Ofir Nachum and Bo Dai and Emma Brunskill},
  journal= {arXiv preprint arXiv:2211.02016},
  year   = {2022}
}