中文

面向方差感知型多臂赌博机算法的公平评估框架

机器学习 2025-11-03 v1 人工智能

摘要

多臂赌博机(MAB)问题是更复杂强化学习算法的基本构件。然而,由于缺乏标准化条件和可复制性,评估和比较MAB算法仍然具有挑战性。这在尤其影响对UCB等经典方法的方差感知扩展进行评估时尤为突出,其性能高度依赖于底层环境。在本研究中,我们探讨了如何可靠地观察赌博机算法之间的性能差异,以及在何种条件下方差感知算法优于经典算法。我们呈现了一个可重复的评估方案,旨在系统性地比较八个经典和方差感知MAB算法。评估框架实现于我们的Bandit Playground代码库中,包含明确定义的实验设置、多个绩效指标(奖励、后悔、奖励分布、价值-at-risk和动作最优性),以及支持一致和透明分析的交互式评估界面。我们表明,在高不确定性环境中,方差感知算法可提供优势,尤其是在臂奖励细微差异导致困难的情形。在 contrast,经典算法在更易分离的情境或广泛微调后往往表现同样出色或更好。我们的贡献有两个:(1)MAB算法系统评估框架,(2)洞察方差感知方法在何种条件下优于其经典对手的条件。

关键词

引用

@article{arxiv.2510.27001,
  title  = {A Framework for Fair Evaluation of Variance-Aware Bandit Algorithms},
  author = {Elise Wolf},
  journal= {arXiv preprint arXiv:2510.27001},
  year   = {2025}
}

备注

Preprint of a paper presented at GI Skill 2025. The final version will appear in the conference proceedings