中文

序列预算学习中的置信度-预算匹配

机器学习 2021-07-13 v2 机器学习

摘要

不确定性下决策的一个核心要素是对所执行动作质量的反馈。然而,在许多应用中,此类反馈受到限制。例如,在推荐系统中,反复要求用户对推荐质量提供反馈会惹恼他们。在这项工作中,我们形式化了带查询预算的决策问题,其中允许的奖励查询次数存在(可能依赖于时间的)硬性限制。具体而言,我们考虑多臂老虎机、线性老虎机和强化学习问题。我们首先分析了‘贪婪’算法的性能,这些算法在能够查询时就会查询奖励。我们表明,在完全随机的设置中,这样做表现得出奇地好,但在存在任何对抗的情况下,这可能导致线性后悔。为克服此问题,我们提出了置信度-预算匹配(CBM)原则,该原则在置信区间宽于可用预算的平方根倒数时查询奖励。我们分析了基于CBM的算法在不同设置下的性能,并表明它们在上下文、初始状态和预算存在对抗时表现良好。

关键词

引用

@article{arxiv.2102.03400,
  title  = {Confidence-Budget Matching for Sequential Budgeted Learning},
  author = {Yonathan Efroni and Nadav Merlis and Aadirupa Saha and Shie Mannor},
  journal= {arXiv preprint arXiv:2102.03400},
  year   = {2021}
}

备注

Accepted to ICML 2021