中文

来自去中心化学习智能体的(近乎)免费激励探索

机器学习 2021-10-28 v1 信息论 机器学习 math.IT

摘要

多臂老虎机(MAB)中的激励探索近年来受到越来越多的关注并取得诸多进展,其中委托人向智能体提供奖励以代其进行探索。然而,几乎所有现有研究都局限于短期近视型智能体。本工作打破这一壁垒,研究涉及多个长期战略性智能体的激励探索,这类智能体具有更复杂的、常出现于真实应用中的行为。本工作的一个重要观察是,战略性智能体自身的学习需求通过提供“免费拉动”而有益于(而非损害)委托人的探索。此外,增加智能体数量可显著降低委托人的激励负担。我们结果中揭示的关键且有些令人惊讶的洞见是:当涉及足够多的学习智能体时,委托人的探索过程可(近乎)免费。我们的主要结果建立在三个新颖且可能具有独立意义的组成部分之上:(1)一种简单且可证明有效的激励提供策略;(2)一种为不等置信度下聚合奖励精心设计的Best Arm识别算法;(3)UCB算法的高概率有限时间下界。我们提供了实验结果以补充理论分析。

关键词

引用

@article{arxiv.2110.14628,
  title  = {(Almost) Free Incentivized Exploration from Decentralized Learning Agents},
  author = {Chengshuai Shi and Haifeng Xu and Wei Xiong and Cong Shen},
  journal= {arXiv preprint arXiv:2110.14628},
  year   = {2021}
}

备注

Accepted to NeurIPS 2021, camera-ready version