中文

激励型 Lipschitz 多臂老虎机

机器学习 2025-08-28 v1 人工智能

摘要

我们研究在以连续度量空间中建模的多臂老虎机 (MAB) 设置下,通过激励引导探索的情形。不同于经典老虎机模型,我们考虑决策者(principal)通过补偿激励盲目代理人超越其贪心选择的探索行为,但存在奖励漂移——由于激励导致的偏置反馈。我们提出了新的激励探索算法,通过在无限臂空间中进行均匀离散化,演示这些算法同时实现亚线性累积报酬和亚线性总补偿。具体地,我们推导了 O~(Td+1/d+2)\tilde{O}(T^{d+1/d+2}) 的报酬和补偿上界,其中 dd 表示度量空间的覆盖维数。此外,我们将结果推广到情境老虎机,获得了相当的性能保证。我们通过数值仿真验证了理论发现。

关键词

引用

@article{arxiv.2508.19466,
  title  = {Incentivized Lipschitz Bandits},
  author = {Sourav Chakraborty and Amit Kiran Rege and Claire Monteleoni and Lijun Chen},
  journal= {arXiv preprint arXiv:2508.19466},
  year   = {2025}
}