基于数据驱动模拟平台的UCB算法遗忘机制实证比较
机器学习
2025-11-25 v1
摘要
许多真实的赌博机问题涉及非平稳奖励分布,其中最优决策可能因环境演化而发生偏移。然而,一些典型的多臂赌博机(MAB)模型如上置信界(UCB)算法在奖励分布随时间变化的非平稳环境中性能显著下降。为解决这一局限,本文提出并评估了FDSW-UCB——一种新颖的双视角算法,将基于折扣的长期视角与基于滑动窗口的短期视角相集成。构建了一个基于MovieLens-1M和Open Bandit数据集的数据驱动半合成模拟平台,用于测试算法在突变和渐变漂移场景下的适应性。实验结果表明,配置良好的滑动窗口机制(SW-UCB)具有鲁棒性,而广泛使用的折扣方法(D-UCB)存在根本性的学习失败,导致线性遗憾。关键的是,所提出的FDSW-UCB在采用乐观聚合策略时,在动态设置中取得了优越性能,凸显了集成策略本身是成功的决定性因素。
引用
@article{arxiv.2511.19240,
title = {Empirical Comparison of Forgetting Mechanisms for UCB-based Algorithms on a Data-Driven Simulation Platform},
author = {Minxin Chen},
journal= {arXiv preprint arXiv:2511.19240},
year = {2025}
}