非平稳随机多臂老虎机的激励式探索
机器学习
2024-03-19 v1 人工智能
机器学习
摘要
我们研究了在奖励分布非平稳的多臂老虎机问题中的激励式探索问题,其中玩家可获得对探索除贪心选择之外的臂的补偬,可能对奖势提供偏差反馈。我们考虑两种不同的非平稳环境:突变式和连续式,并分别提出相应的激励式探索算法。我们证明,所提出的算法在时间上实现亚线性的 regret 与补偿,从而有效地在非平稳性以及偏差或漂移反馈下激励探索。
引用
@article{arxiv.2403.10819,
title = {Incentivized Exploration of Non-Stationary Stochastic Bandits},
author = {Sourav Chakraborty and Lijun Chen},
journal= {arXiv preprint arXiv:2403.10819},
year = {2024}
}