中文

预算约束下带放弃选项的序贯奖励最大化

机器学习 2020-03-26 v1 人工智能 机器学习

摘要

我们考虑一个序贯决策问题,其中智能体一次可采取一个动作,且每个动作具有随机的时间跨度,即在新动作完成前不能采取新动作。完成后,所选动作产生随机奖励。智能体寻求在有限时间预算内最大化其累积奖励,并拥有“放弃”当前动作的选项——从而放弃任何奖励——以选择另一动作。我们将此问题视为一类具有随机资源消耗的随机多臂老虎机问题。对于该问题,我们首先确定最优臂是使该臂期望奖励与因拉动该臂而智能体看到奖励前期望等待时间之比最大的臂。利用关于该比值的新型上置信界,我们随后引入了一种基于上置信界的算法 WAIT-UCB,并为其建立了对数级的、依赖于问题的后悔界,与先前工作相比其对问题参数的依赖有所改善。我们还给出了在各种问题配置下 WAIT-UCB 与最先进算法的比较模拟。

关键词

引用

@article{arxiv.2003.03456,
  title  = {A Farewell to Arms: Sequential Reward Maximization on a Budget with a Giving Up Option},
  author = {P Sharoff and Nishant A. Mehta and Ravi Ganti},
  journal= {arXiv preprint arXiv:2003.03456},
  year   = {2020}
}

备注

16 pages, AISTATS 2020