中文

具有正外部性的赌博机学习

机器学习 2019-03-08 v5 机器学习

摘要

在许多平台中,用户到达表现出自我强化行为:未来的用户到达很可能具有与过去满意用户相似的偏好。换言之,到达表现出正外部性。我们研究具有正外部性的多臂赌博机(MAB)问题。我们表明,这种自我强化的偏好可能导致诸如 UCB 等标准基准算法呈现线性后悔。我们开发了一种新算法——平衡探索(BE),该算法谨慎地探索臂,以在收集到充分证据之前避免到达的次优收敛。我们还引入了 BE 的自适应变体,该变体依次消除次优臂。我们分析了它们的渐近后悔,并通过证明任何算法都无法表现得更好而确立了最优性。

关键词

引用

@article{arxiv.1802.05693,
  title  = {Bandit Learning with Positive Externalities},
  author = {Virag Shah and Jose Blanchet and Ramesh Johari},
  journal= {arXiv preprint arXiv:1802.05693},
  year   = {2019}
}

备注

31 pages, 1 table, 2 figures