中文

随机组合半老虎机问题的紧遗憾界

机器学习 2017-06-08 v3 人工智能 最优化与控制 机器学习

摘要

随机组合半老虎机是一种在线学习问题,其中学习代理在每一步根据约束选择一组基础项的子集,随后观察这些项的随机权重并获得其总和作为收益。本文解决了随机组合半老虎机中计算高效且样本高效的学习问题。具体而言,我们分析了一种用于解决该问题的类 UCB 算法,该算法已知具有计算高效性;并证明了其 nn 步遗憾的上界为 O(KL(1/Δ)logn)O(K L (1 / \Delta) \log n)O(KLnlogn)O(\sqrt{K L n \log n}),其中 LL 是基础项的数量,KK 是所选项的最大数量,Δ\Delta 是最优解与最佳次优解的期望回报之间的差距。依赖于差距的界在常数因子内是紧的,而无差距的界在多对数因子内是紧的。

关键词

引用

@article{arxiv.1410.0949,
  title  = {Tight Regret Bounds for Stochastic Combinatorial Semi-Bandits},
  author = {Branislav Kveton and Zheng Wen and Azin Ashkan and Csaba Szepesvari},
  journal= {arXiv preprint arXiv:1410.0949},
  year   = {2017}
}

备注

Proceedings of the 18th International Conference on Artificial Intelligence and Statistics