随机_bandit中的滑动后悔:判别性指标与随机化策略
机器学习
2023-12-01 v1 系统与控制
系统与控制
最优化与控制
机器学习
摘要
本文研究随机_bandit中无后悔算法的单次运行行为。尽管许多算法在期望后悔方面被已知为渐近最优,但在单次运行中,其伪后悔似乎遵循两种趋势之一:平滑或崎岖。为度量该趋势,我们引入一个新概念:滑动后悔,其度量在滑动至无穷的固定长度时间窗上的最差伪后悔。我们证明随机化方法(例如Thompson Sampling与MED)具有最优滑动后悔,而指标策略尽管在期望后悔上可能渐近最优,但在其指标满足正则性条件时(例如UCB、UCB-V、KL-UCB、MOSS、IMED等)具有可能最差的滑动后悔。我们进一步通过探索后悔分析指标策略伪后悔的平均崎岖度,并证明其亦为次优。
引用
@article{arxiv.2311.18437,
title = {The Sliding Regret in Stochastic Bandits: Discriminating Index and Randomized Policies},
author = {Victor Boone},
journal= {arXiv preprint arXiv:2311.18437},
year = {2023}
}
备注
31 pages