利用信念惯性欺骗非平稳多臂老虎机中的算法
机器学习
2025-11-11 v1 概率论
机器学习
摘要
我们研究了分段平稳多臂老虎机问题中的最坏情形 regret。虽然平稳老虎机的最小损失理论已为人所知,但在动态环境中理解类似限制却富有挑战性。现有下界依赖我们称之为稀疏抽样论证,其中在缺乏探索的长时间间隔内允许对抗性奖励变化,从而引起较大的 regret。本文引入一种根本不同的方法,基于信念惯性论证。我们的分析捕捉了算法的经验性信念——通过历史奖励平均值编码——在变化后抗拒新证据的动力学。我们展示了如何利用这种惯性来构建误导经典算法(如 Explore Then Commit、epsilon 贪嗪和 UCB)的对抗实例,使其无论如何调整参数,都可能导致随 T 线性增长的 regret,并伴随 substantial constant factor,即便仅有一个 change point。我们将分析扩展到定期重启以处理非平稳性的算法,并证明即便如此,最坏情形的 regret 仍然是 T 的线性。我们的结果表明,利用信念惯性可是派生尖锐下界的强大方法。
引用
@article{arxiv.2511.05620,
title = {Fooling Algorithms in Non-Stationary Bandits using Belief Inertia},
author = {Gal Mendelson and Eyal Tadmor},
journal= {arXiv preprint arXiv:2511.05620},
year = {2025}
}