在线潘多拉魔盒与多臂老虎机问题
数据结构与算法
2019-01-31 v1 人工智能
计算机科学与博弈论
机器学习
摘要
我们考虑潘多拉魔盒问题(Pandora's box problem, Weitzman. 1979)的在线变体,该问题是理解与获取信息成本相关的决策问题的标准模型。我们的问题推广了经典潘多拉魔盒问题和先知不等式(prophet inequality)框架。盒子以在线方式呈现,每个盒子具有从某已知分布联合抽取随机价值和成本。Pandora根据成本在线决定是否打开每个盒子,然后不可撤销地选择保留揭示的奖品或放弃。我们的目标是对抗以下对手:该对手可选择任意已打开盒子中的最大奖品,并使用最优离线策略来决定打开哪些盒子(不知内部价值)。我们考虑Pandora可收集多个奖品并受可行性约束(如基数、拟阵或背包约束)的变体。我们还考虑了与强化学习中经典多臂老虎机(multi-armed bandit)问题相关的变体。我们的结果使用基于约简的框架,将获取信息的成本问题与保留哪些奖品的在线决策过程分离。我们的工作表明,在许多场景下,Pandora可以取得接近最优可能性能的近似。
引用
@article{arxiv.1901.10698,
title = {Online Pandora's Boxes and Bandits},
author = {Hossein Esfandiari and MohammadTaghi Hajiaghayi and Brendan Lucier and Michael Mitzenmacher},
journal= {arXiv preprint arXiv:1901.10698},
year = {2019}
}