激励型 Lipschitz 多臂老虎机
机器学习
2025-08-28 v1 人工智能
摘要
我们研究在以连续度量空间中建模的多臂老虎机 (MAB) 设置下,通过激励引导探索的情形。不同于经典老虎机模型,我们考虑决策者(principal)通过补偿激励盲目代理人超越其贪心选择的探索行为,但存在奖励漂移——由于激励导致的偏置反馈。我们提出了新的激励探索算法,通过在无限臂空间中进行均匀离散化,演示这些算法同时实现亚线性累积报酬和亚线性总补偿。具体地,我们推导了 的报酬和补偿上界,其中 表示度量空间的覆盖维数。此外,我们将结果推广到情境老虎机,获得了相当的性能保证。我们通过数值仿真验证了理论发现。
关键词
引用
@article{arxiv.2508.19466,
title = {Incentivized Lipschitz Bandits},
author = {Sourav Chakraborty and Amit Kiran Rege and Claire Monteleoni and Lijun Chen},
journal= {arXiv preprint arXiv:2508.19466},
year = {2025}
}