高斯多臂老虎机UCB规则的随机微分方程极限描述
机器学习
2023-05-12 v3 最优化与控制
统计理论
统计理论
摘要
我们考虑具有已知控制时域大小 的高斯多臂老虎机上的上置信界策略,并利用随机微分方程与常微分方程系统构建其极限描述。假设各臂的奖励具有未知期望值和已知方差。针对奖励分布相近的情形(即平均奖励相差 量级,此时产生最高归一化后悔)进行了一组蒙特卡洛模拟,以验证所获描述的有效性。我们估计了归一化后悔不明显大于最大可能值时控制时域的最小大小。
引用
@article{arxiv.2112.06423,
title = {Stochastic differential equations for limiting description of UCB rule for Gaussian multi-armed bandits},
author = {Sergey Garbar},
journal= {arXiv preprint arXiv:2112.06423},
year = {2023}
}
备注
9 pages, 2 figures