中文

代价感知的级联赌博机

机器学习 2018-05-23 v1 信息论 math.IT 机器学习

摘要

在本文中,我们提出一种代价感知的级联赌博机模型,这是具有级联反馈的多臂赌博机的一个新变体,其考虑了拉动臂的随机代价。在每一步,学习智能体选择一个有序的物品列表并依次检查,直到满足某个停止条件。我们的目标是通过决定物品的有序列表以及何时停止检查,来最大化每一步的期望净收益,即每一步获得的收益减去检查物品所产生的总代价。我们研究了离线和在线两种设定,取决于物品的状态和代价统计是否事先已知。对于离线设定,我们证明单位代价排序带阈值1(UCR-T1)策略是最优的。对于在线设定,我们提出一种代价感知级联上置信界(CC-UCB)算法,并证明累积后悔界为O(logT)O(\log T)。我们还给出了所有α\alpha-一致策略的下界,其尺度为Ω(logT)\Omega(\log T),与我们的上界相匹配。CC-UCB算法的性能在合成数据和真实世界数据上均进行了评估。

关键词

引用

@article{arxiv.1805.08638,
  title  = {Cost-aware Cascading Bandits},
  author = {Ruida Zhou and Chao Gan and Jing Yan and Cong Shen},
  journal= {arXiv preprint arXiv:1805.08638},
  year   = {2018}
}

备注

11 pages, 2 figures, IJCAI 2018