中文

一种具有对数遗憾的占优策略诚实确定性多臂老虎机机制

计算机科学与博弈论 2020-06-01 v2

摘要

随机多臂老虎机 (MAB) 机制被广泛应用于赞助搜索拍卖、众包、在线采购等领域。文献中提出的具有确定性支付规则的现有随机 MAB 机制必然承受 Ω(T2/3)\Omega(T^{2/3}) 的遗憾,其中 TT 为时间步数。这是因为现有机制考虑了最坏情况,即智能体的随机奖励均值被极小的、依赖于 TT 的量所分隔。我们提出并利用了一个关键观察:在大多数场景下,智能体奖励之间的分隔极少是 TT 的函数。此外,当臂的奖励任意接近时,此类次优臂所贡献的遗憾极小。我们的想法是允许中心指明区分智能体所需的分辨率 Δ\Delta。这直接促使我们引入 Δ\Delta-Regret 的概念。以赞助搜索拍卖为具体示例(相同思想也适用于其他应用),我们提出了一种占优策略激励相容 (DSIC) 且个体理性 (IR) 的确定性 MAB 机制,该机制基于多臂老虎机算法的 Upper Confidence Bound (UCB) 族思想。值得注意的是,所提出的 Δ\Delta-UCB 机制在赞助搜索拍卖场景下实现了 O(logT)O(\log T)Δ\Delta-regret。我们首先针对单广告位赞助搜索拍卖建立结果,随后将其非平凡地推广至多个广告位分配的情形。

关键词

引用

@article{arxiv.1703.00632,
  title  = {A Dominant Strategy Truthful, Deterministic Multi-Armed Bandit Mechanism with Logarithmic Regret},
  author = {Divya Padmanabhan and Satyanath Bhat and Prabuchandran K. J. and Shirish Shevade and Y. Narahari},
  journal= {arXiv preprint arXiv:1703.00632},
  year   = {2020}
}