中文

有限预算下半带反馈非随机组合赌博机中的最优臂寻找

机器学习 2022-10-17 v2 机器学习

摘要

我们考虑在有限采样预算约束下的半带反馈组合赌博机问题,其中学习者执行其动作的次数仅限于由总体预算指定的有限次数。动作是选择一组臂,随后接收所选集合中每个臂的反馈。与现有工作不同,我们在非随机设定下研究此问题,具有子集依赖反馈,即接收到的半带反馈可能由无记忆对手生成,并且也可能依赖于所选的臂集合。此外,我们考虑一个涵盖基于数值与基于偏好情形的通用反馈场景,并为该设定引入一个合理的理论框架,保证最优臂的恰当概念,学习者旨在寻找此类最优臂。我们提出一种通用算法,适用于涵盖从激进到保守的整个可想见的臂消除策略谱系。关于算法寻找最佳臂所需充分与必要预算的理论问题得到解答,并通过推导该问题场景下任意学习算法的下界加以补充。

关键词

引用

@article{arxiv.2202.04487,
  title  = {Finding Optimal Arms in Non-stochastic Combinatorial Bandits with Semi-bandit Feedback and Finite Budget},
  author = {Jasmin Brandt and Viktor Bengs and Björn Haddenhorst and Eyke Hüllermeier},
  journal= {arXiv preprint arXiv:2202.04487},
  year   = {2022}
}