具有正外部性的赌博机学习
机器学习
2019-03-08 v5 机器学习
摘要
在许多平台中,用户到达表现出自我强化行为:未来的用户到达很可能具有与过去满意用户相似的偏好。换言之,到达表现出正外部性。我们研究具有正外部性的多臂赌博机(MAB)问题。我们表明,这种自我强化的偏好可能导致诸如 UCB 等标准基准算法呈现线性后悔。我们开发了一种新算法——平衡探索(BE),该算法谨慎地探索臂,以在收集到充分证据之前避免到达的次优收敛。我们还引入了 BE 的自适应变体,该变体依次消除次优臂。我们分析了它们的渐近后悔,并通过证明任何算法都无法表现得更好而确立了最优性。
引用
@article{arxiv.1802.05693,
title = {Bandit Learning with Positive Externalities},
author = {Virag Shah and Jose Blanchet and Ramesh Johari},
journal= {arXiv preprint arXiv:1802.05693},
year = {2019}
}
备注
31 pages, 1 table, 2 figures