离线策略选择何时对强化学习具有样本效率?
机器学习
2026-02-17 v2 人工智能
摘要
离线强化学习算法通常需要仔细的超参数调优。在部署之前,我们需要从一组候选策略中进行选择。然而,对于这种离线策略选择(OPS)问题的基本极限,人们的理解仍然有限。在这项工作中,我们主要通过将 OPS 与离线策略评估(OPE)和 Bellman 误差(BE)估计联系起来,阐明了何时可以实现具有样本效率的 OPS。我们首先展示了一个困难性结果,即在最坏情况下,OPS 与 OPE 一样困难,这通过证明 OPE 到 OPS 的归约来实现。因此,在最坏情况下,没有任何 OPS 方法能比 OPE 具有更高的样本效率。然后,我们将 BE 估计与 OPS 问题联系起来,展示了如何将 BE 用作 OPS 的工具。虽然基于 BE 的方法通常比 OPE 要求更强的条件,但当这些条件满足时,它们可以具有更高的样本效率。基于这一见解,我们提出了一种用于 OPS 的 BE 方法,称为可识别 BE 选择(IBES),该方法具有直接选择其自身超参数的简便方法。最后,我们通过实证研究比较了 OPE 和 IBES,并在离线 Atari 基准数据集上展示了 OPS 的困难性。
引用
@article{arxiv.2312.02355,
title = {When is Offline Policy Selection Sample Efficient for Reinforcement Learning?},
author = {Vincent Liu and Prabhat Nagarajan and Andrew Patterson and Martha White},
journal= {arXiv preprint arXiv:2312.02355},
year = {2026}
}
备注
AAMAS 2026