中文

经济推荐系统

计算机科学与博弈论 2015-07-31 v2

摘要

在机器学习核心的在线 Explore and Exploit 文献中,中央规划者面临一组备选方案,每个方案产生未知奖励。规划者的目标是通过实验尽快学习到最优备选方案。该模型中的一个典型假设是规划者对实验设计和实施拥有完全控制权。当实验由一个由自我驱动的智能体组成的社会实施时,规划者只能建议实验而无力强制执行。Kremer 等 (JPE, 2014) 首次研究考虑智能体激励的 explore and exploit 方案。在他们的模型中,隐含假设智能体之间互不可见且不进行交流。他们的主要结果是对最优 explore and exploit 方案的刻画。在本工作中,我们通过添加一个社交网络层来扩展 Kremer 等 (JPE, 2014) 的工作,智能体可以根据该网络相互观察。事实证明,当考虑可观察性时,Kremer 等 (JPE, 2014) 提出的方案不再满足激励兼容性。在我们的主要结果中,我们给出了一个紧界,限制每个智能体在仍能保持激励兼容算法和渐近最优结果的情况下最多可以观察多少其他智能体。更具体地,对于一个具有 NN 个智能体且度数大于 NαN^\alpha 的节点数以 NβN^\beta 为界的设定,若 2α+β<12*\alpha+\beta < 1,我们构造了激励兼容的渐近最优机制。我们证明了界限 2α+β<12*\alpha+\beta < 1 是紧的。

关键词

引用

@article{arxiv.1507.07191,
  title  = {Economic Recommendation Systems},
  author = {Gal Bahar and Rann Smorodinsky and Moshe Tennenholtz},
  journal= {arXiv preprint arXiv:1507.07191},
  year   = {2015}
}