中文

离线强化学习中的模型选择:新算法与实验协议

机器学习 2025-10-27 v3 人工智能 机器学习

摘要

离线强化学习 (RL) 中的 holdout 验证和来自数据的超参数调优是长期以来的难题。常用方法是使用 off-policy evaluation (OPE) 来评估和选择策略,但 OPE 要么导致指数级方差(如重要性抽样),要么在其自身上具有超参数(如 FQE 和基于模型的方法)。我们聚焦于对 OPE 本身的超参数调优,这更少受关注。具体而言,我们在候选价值函数(“model-free”)或动力学(“model-based”)之间进行选择,以最佳评估目标策略的性能。我们发展了:(1)具有理论保证的新的 model-free 和 model-based 选择器,以及(2)用于 empirically 评估它们的新实验协议。与先前工作中的 model-free 协议相比,我们的新协议允许更稳定地生成并更好地控制候选价值函数,以一种无需优化的方式进行评估,并且可以对 model-free 和 model-based 方法进行评估。我们以 Gym-Hopper 为例,发现我们的新的 model-free 选择器 LSTD-Tournament 在实证性能上表现前景良好。

关键词

引用

@article{arxiv.2502.08021,
  title  = {Model Selection for Off-policy Evaluation: New Algorithms and Experimental Protocol},
  author = {Pai Liu and Lingfeng Zhao and Shivangi Agarwal and Jinghan Liu and Audrey Huang and Philip Amortila and Nan Jiang},
  journal= {arXiv preprint arXiv:2502.08021},
  year   = {2025}
}