中文

具有瓶颈奖励函数的组合纯探索问题

机器学习 2021-10-27 v2

摘要

在本文中,我们在固定置信度(FC)和固定预算(FB)设定下研究具有瓶颈奖励函数(CPE-B)的组合纯探索问题。在 CPE-B 中,给定一组基础臂以及遵循某种组合约束的基础臂子集(超级臂)集合,学习者依次播放一个基础臂并观测其随机奖励,目标是找到具有最大瓶颈值的优化超级臂,瓶颈值定义为该超级臂所含基础臂的最小期望奖励。CPE-B 涵盖了诸如通信网络中的网络路由等多种实际场景,其独特挑战在于如何利用瓶颈性质节省样本并实现统计最优性。现有 CPE 研究(大多假设线性奖励)均无法适应此类挑战,因此我们开发了全新的技术来处理它们。对于 FC 设定,我们提出了对广泛实例具有最优样本复杂度的新算法,并建立了匹配的下界以证明最优性(在对数因子范围内)。对于 FB 设定,我们设计了一种算法,与现有 CPE 算法相比,其实现了最先进的错误概率保证,并且是首个能在固定预算路径实例上高效运行的算法。我们在 top-kk、路径和匹配实例上的实验结果验证了所提算法相对于基线的经验优越性。

关键词

引用

@article{arxiv.2102.12094,
  title  = {Combinatorial Pure Exploration with Bottleneck Reward Function},
  author = {Yihan Du and Yuko Kuroki and Wei Chen},
  journal= {arXiv preprint arXiv:2102.12094},
  year   = {2021}
}