HAVER:最大均值估计的实例相关误差界及其在 Q 学习和蒙特卡洛树搜索中的应用
机器学习
2025-04-30 v2 机器学习
摘要
我们研究了通过样本来估计 K 个分布中最大均值的问题(而不是估计哪个分布具有最大均值),这源于各种机器学习任务,包括 Q 学习和蒙特卡洛树搜索(MCTS)。尽管已提出了少数算法,但其性能分析仅限于偏差,而非精确误差度量。本文提出一种新算法,称为 HAVER(Head AVERaging),并分析其均方误差。我们的分析揭示了 HAVER 在两个方面都表现出色。首先,HAVER 能像知道最佳分布身份的 oracle 一样准确地估计最大均值并报告其样本均值。其次,或许出乎意料的是,当存在许多接近最佳分布的分布时,HAVER 的误差率甚至优于该 oracle。这些改进是文献中首次实现的,我们还证明了报告最大经验均值的 naive 算法无法实现这些界限。最后,我们通过数值实验确认了理论发现,在这些实验中,我们在 bandit、Q 学习和 MCTS 算法中实现了 HAVER,HAVER 在 various 基准方法中 consistently 优于基准方法,展示了其在不同应用中的有效性。
引用
@article{arxiv.2411.00405,
title = {HAVER: Instance-Dependent Error Bounds for Maximum Mean Estimation and Applications to Q-Learning and Monte Carlo Tree Search},
author = {Tuan Ngo Nguyen and Jay Barrett and Kwang-Sung Jun},
journal= {arXiv preprint arXiv:2411.00405},
year = {2025}
}
备注
In Proceedings of the Artificial Intelligence and Statistics (AISTATS) 2025