中文

在线潘多拉魔盒与多臂老虎机问题

数据结构与算法 2019-01-31 v1 人工智能 计算机科学与博弈论 机器学习

摘要

我们考虑潘多拉魔盒问题(Pandora's box problem, Weitzman. 1979)的在线变体,该问题是理解与获取信息成本相关的决策问题的标准模型。我们的问题推广了经典潘多拉魔盒问题和先知不等式(prophet inequality)框架。盒子以在线方式呈现,每个盒子具有从某已知分布联合抽取随机价值和成本。Pandora根据成本在线决定是否打开每个盒子,然后不可撤销地选择保留揭示的奖品或放弃。我们的目标是对抗以下对手:该对手可选择任意已打开盒子中的最大奖品,并使用最优离线策略来决定打开哪些盒子(不知内部价值)。我们考虑Pandora可收集多个奖品并受可行性约束(如基数、拟阵或背包约束)的变体。我们还考虑了与强化学习中经典多臂老虎机(multi-armed bandit)问题相关的变体。我们的结果使用基于约简的框架,将获取信息的成本问题与保留哪些奖品的在线决策过程分离。我们的工作表明,在许多场景下,Pandora可以取得接近最优可能性能的近似。

关键词

引用

@article{arxiv.1901.10698,
  title  = {Online Pandora's Boxes and Bandits},
  author = {Hossein Esfandiari and MohammadTaghi Hajiaghayi and Brendan Lucier and Michael Mitzenmacher},
  journal= {arXiv preprint arXiv:1901.10698},
  year   = {2019}
}