中文

超参数优化在离策略学习中甚至可能有害及其应对方法

机器学习 2024-04-24 v1

摘要

近年来,离策略评估在推荐系统和个性化医疗等领域引起了越来越多的关注。我们已看到在开发旨在基于有偏日志数据准确估计反事实策略有效性的估计器方面取得了显著进展。然而,在许多情况下,这些估计器不仅用于评估决策策略的价值,还用于从大型候选空间中搜索最佳超参数。本文探讨了离策略学习中的超参数优化(HPO)任务。我们通过实验表明,在HPO中天真地使用泛化性能的无偏估计量作为替代目标可能导致意外失败,仅仅追求那些泛化性能被严重高估的超参数。然后,我们提出了简单且计算高效的修正方法,以同时处理上述问题。实验研究表明,在典型程序严重失败的情况下,我们提出的HPO算法是有效的。

关键词

引用

@article{arxiv.2404.15084,
  title  = {Hyperparameter Optimization Can Even be Harmful in Off-Policy Learning and How to Deal with It},
  author = {Yuta Saito and Masahiro Nomura},
  journal= {arXiv preprint arXiv:2404.15084},
  year   = {2024}
}

备注

IJCAI'24