中文

赌博机设置下的单峰单部匹配

机器学习 2022-08-03 v1 数据结构与算法

摘要

我们处理一个新兴问题,即在加权图中寻找最优单部匹配。半赌博机版本(每次迭代采样一个完整匹配)已由 \cite{ADMA} 解决,其创建的算法具有期望后悔 O(Llog(L)Δlog(T))O(\frac{L\log(L)}{\Delta}\log(T)),其中含 2L2L 个参与者、TT 次迭代和最小奖励间隙 Δ\Delta。我们分两步降低该界。首先,如 \cite{GRAB} 和 \cite{UniRank} 中那样,我们利用适当图上期望奖励的单峰性,设计出一种后悔为 O(L1Δlog(T))O(L\frac{1}{\Delta}\log(T)) 的算法。其次,我们表明,通过将焦点转向主要问题“\emph{用户 ii 是否优于用户 jj?}”,该后悔变为 O(LΔΔ~2log(T))O(L\frac{\Delta}{\tilde{\Delta}^2}\log(T)),其中 \TildeΔ>Δ\Tilde{\Delta} > \Delta 源于一种更好的用户比较方式。一些实验结果最终表明这些理论结果在实践中得到印证。

关键词

引用

@article{arxiv.2208.01511,
  title  = {Unimodal Mono-Partite Matching in a Bandit Setting},
  author = {Romaric Gaudel and Matthieu Rodet},
  journal= {arXiv preprint arXiv:2208.01511},
  year   = {2022}
}