赌博机设置下的单峰单部匹配
机器学习
2022-08-03 v1 数据结构与算法
摘要
我们处理一个新兴问题,即在加权图中寻找最优单部匹配。半赌博机版本(每次迭代采样一个完整匹配)已由 \cite{ADMA} 解决,其创建的算法具有期望后悔 ,其中含 个参与者、 次迭代和最小奖励间隙 。我们分两步降低该界。首先,如 \cite{GRAB} 和 \cite{UniRank} 中那样,我们利用适当图上期望奖励的单峰性,设计出一种后悔为 的算法。其次,我们表明,通过将焦点转向主要问题“\emph{用户 是否优于用户 ?}”,该后悔变为 ,其中 源于一种更好的用户比较方式。一些实验结果最终表明这些理论结果在实践中得到印证。
引用
@article{arxiv.2208.01511,
title = {Unimodal Mono-Partite Matching in a Bandit Setting},
author = {Romaric Gaudel and Matthieu Rodet},
journal= {arXiv preprint arXiv:2208.01511},
year = {2022}
}