广义高斯多臂赌博机中的人类决策建模
机器学习
2019-12-23 v5 最优化与控制
机器学习
摘要
我们提出了一个在探索-利用任务中人类决策的形式化模型,使用多臂赌博机问题的背景,其中决策者必须在多个具有不确定奖励的选项中进行选择。我们处理了标准多臂赌博机问题、具有转移成本的多臂赌博机问题以及图上的多臂赌博机问题。我们关注高斯奖励的情况,其中决策者使用贝叶斯推断来估计奖励值。我们用关于平均奖励的贝叶斯先验来建模决策者的先验知识。我们为标准多臂赌博机问题开发了上置信限(UCL)算法,并证明该确定性算法实现了对数累积期望遗憾,这对于无信息先验是最优性能。我们展示了良好的先验和对臂之间相关结构的良好假设如何能够极大地提高决策性能,即使在短时间范围内也是如此。我们扩展到随机UCL算法,并与人类决策行为建立了若干联系。我们展示了来自人类实验的经验数据,并表明人类性能可以通过具有适当参数的随机UCL算法有效捕获。对于具有转移成本的多臂赌博机问题和图上的多臂赌博机问题,我们分别将UCL算法推广到块UCL算法和图块UCL算法。我们证明这些算法也实现了对数累积期望遗憾,并且需要亚对数期望的臂间转移次数。我们进一步通过数值例子说明了这些算法的性能。注意:本版本中包含的附录G详细说明了纠正先前已发表证明中疏忽的微小修改。文本的其余部分反映了已发表的工作。
引用
@article{arxiv.1307.6134,
title = {Modeling Human Decision-making in Generalized Gaussian Multi-armed Bandits},
author = {Paul Reverdy and Vaibhav Srivastava and Naomi E. Leonard},
journal= {arXiv preprint arXiv:1307.6134},
year = {2019}
}
备注
25 pages. Appendix G included in this version details minor modifications that correct for an oversight in the previously-published proofs. The remainder of the text reflects the previously-published version