中文

重新审视用于离线模型选择的贝尔曼误差

机器学习 2023-10-18 v2 人工智能 机器学习

摘要

离线模型选择(OMS),即仅给定日志数据从多个策略中选出最优策略,对于在真实场景中应用离线 RL 至关重要。一个被广泛探讨的思路是基于相关 Q 函数的均方贝尔曼误差(MSBE)来选择策略。然而,先前工作难以利用贝尔曼误差获得充分的 OMS 性能,导致许多研究者放弃了该思路。为此,我们阐明了先前工作使用贝尔曼误差得到悲观结果的原因,并确定了基于贝尔曼误差的 OMS 算法表现良好的条件。此外,我们开发了一种比已有方法更精确的 MSBE 估计器。我们的估计器在包括 Atari 游戏在内的多种离散控制任务上取得了令人印象深刻的 OMS 性能。

关键词

引用

@article{arxiv.2302.00141,
  title  = {Revisiting Bellman Errors for Offline Model Selection},
  author = {Joshua P. Zitovsky and Daniel de Marchi and Rishabh Agarwal and Michael R. Kosorok},
  journal= {arXiv preprint arXiv:2302.00141},
  year   = {2023}
}

备注

Published in ICML 2023