中文

无约束亚调子最大化随机多臂老虎机的对数 regret

机器学习 2025-02-13 v2 组合数学 最优化与控制 机器学习

摘要

我们针对在随机多臂老虎机设置下的在线无约束亚调子最大化问题(Online USM)提出了方法。在此框架下,决策者从一个取值于已知有界区间的非单调亚调子函数中获取带噪声的奖励。本文提出了 Double-Greedy - Explore-then-Commit(DG-ETC)方法,继承了来自离线和在线全信息设置下的 Double-Greedy 方法。DG-ETC 在 1/2 近似伪后悔上满足 O(d log(dT)) 的问题相关上界,同时也具有一个 O(dT^{2/3} log(dT)^{1/3}) 的问题无关上界,优于现有方法。特别是,我们引入了一种问题相关的硬度概念,刻画了上界从对数量级到多项式量级之间的转变。

关键词

引用

@article{arxiv.2410.08578,
  title  = {Logarithmic Regret for Unconstrained Submodular Maximization Stochastic Bandit},
  author = {Julien Zhou and Pierre Gaillard and Thibaud Rahier and Julyan Arbel},
  journal= {arXiv preprint arXiv:2410.08578},
  year   = {2025}
}

备注

Camera-ready version for ALT 2025