中文

异质货币价值下的探索激励

计算机科学与博弈论 2015-12-29 v1

摘要

最近,Frazier等人提出了一种用于不同先验未知选项的众包探索的自然模型:一个委托人关心在多臂老虎机设置中逐个到达的代理人群体的长期福利。然而,每个代理是短视的,因此为了激励他探索具有更好长期前景的选项,委托人必须向代理提供金钱。Frazier等人证明了称为时间扩展的一类简单策略在最坏情况下是最优的,并刻画了它们的预算-奖励权衡。先前的工作假设所有代理对财务激励同等且均匀敏感。实际上,代理可能对金钱具有不同效用。因此,我们扩展了Frazier等人的模型,以允许具有异质和非线性金钱效用的代理。委托人通过一个信息量或多或少的可告知信号得知代理的权衡。我们的主要结果表明,可以使用凸规划推导依赖于信号的时间扩展策略,该策略在最坏情况下实现可能的最佳拉格朗日奖励。所谓“Diamonds in the Rough”实例匹配了最坏情况保证;保证匹配的证明基于证明对于这特定实例两个不同的凸规划具有相同最优解。这些结果也扩展到Frazier等人中的预算情形。我们还表明最优策略关于信息是单调的,即随着信号变得更具信息性,最优策略的近似比改善。

关键词

引用

@article{arxiv.1512.08427,
  title  = {Incentivizing Exploration with Heterogeneous Value of Money},
  author = {Li Han and David Kempe and Ruixin Qiang},
  journal= {arXiv preprint arXiv:1512.08427},
  year   = {2015}
}

备注

WINE 2015