不完美上下文下的鲁棒 Bandit 学习
机器学习
2021-04-06 v3
摘要
上下文多臂 Bandit 的一个标准假设是,在选臂前真实上下文已被完美获知。然而,在许多实际应用(例如云资源管理)中,选臂前上下文信息只能通过带有误差或对抗性修改的预测来获得。本文研究一种上下文 Bandit 设定,其中仅有不完美上下文可用于选臂,而真实上下文在每轮结束时才被揭示。我们提出两种鲁棒选臂算法:最大化最坏情形奖励的 MaxMinUCB(最大化最小 UCB),以及最小化最坏情形遗憾的 MinWD(最小化最坏情形退化)。重要的是,我们通过推导与知晓真实上下文的 oracle 相比的遗憾界与奖励界,分析了 MaxMinUCB 与 MinWD 的鲁棒性。我们的结果表明,随着时间推移,MaxMinUCB 与 MinWD 的渐近表现均与其知晓奖励函数的最优对应算法一样好。最后,我们将 MaxMinUCB 与 MinWD 应用于在线边缘数据中心选择,并运行合成仿真以验证我们的理论分析。
引用
@article{arxiv.2102.05018,
title = {Robust Bandit Learning with Imperfect Context},
author = {Jianyi Yang and Shaolei Ren},
journal= {arXiv preprint arXiv:2102.05018},
year = {2021}
}