重新审视用于离线模型选择的贝尔曼误差
机器学习
2023-10-18 v2 人工智能
机器学习
摘要
离线模型选择(OMS),即仅给定日志数据从多个策略中选出最优策略,对于在真实场景中应用离线 RL 至关重要。一个被广泛探讨的思路是基于相关 Q 函数的均方贝尔曼误差(MSBE)来选择策略。然而,先前工作难以利用贝尔曼误差获得充分的 OMS 性能,导致许多研究者放弃了该思路。为此,我们阐明了先前工作使用贝尔曼误差得到悲观结果的原因,并确定了基于贝尔曼误差的 OMS 算法表现良好的条件。此外,我们开发了一种比已有方法更精确的 MSBE 估计器。我们的估计器在包括 Atari 游戏在内的多种离散控制任务上取得了令人印象深刻的 OMS 性能。
引用
@article{arxiv.2302.00141,
title = {Revisiting Bellman Errors for Offline Model Selection},
author = {Joshua P. Zitovsky and Daniel de Marchi and Rishabh Agarwal and Michael R. Kosorok},
journal= {arXiv preprint arXiv:2302.00141},
year = {2023}
}
备注
Published in ICML 2023