组合多臂老虎机问题中与批量大小无关的悔界
机器学习
2020-06-09 v4 机器学习
摘要
我们考虑组合多臂老虎机(CMAB)问题,其中奖励函数是非线性的。在此设定下,智能体在每轮选择一批臂并从该批的每个臂获得反馈。智能体旨在最大化的奖励是所选臂及其期望的函数。在许多应用中,奖励函数高度非线性,现有算法的性能依赖于一个全局 Lipschitz 常数来封装函数的非线性。这可能导致宽松的悔界,因为仅凭大梯度本身不一定引起大悔值,而仅在奖励参数不确定性高的区域才会。为克服此问题,我们引入一个新的平滑性准则,称之为 \emph{基尼加权平滑性},它同时考虑了奖励的非线性与臂的集中性质。我们证明现有算法中悔值对批量大小的线性依赖可被此平滑参数替代。进而,当平滑参数与批量大小无关时,这带来了紧得多的悔界。例如,在具有许多应用(包括影响力最大化、多样化推荐等)的概率最大覆盖(PMC)问题中,我们在上界上取得了显著改进。我们还证明了 PMC 问题的匹配下界,并表明我们的算法是紧的,至多相差问题参数中的一个对数因子。
引用
@article{arxiv.1905.03125,
title = {Batch-Size Independent Regret Bounds for the Combinatorial Multi-Armed Bandit Problem},
author = {Nadav Merlis and Shie Mannor},
journal= {arXiv preprint arXiv:1905.03125},
year = {2020}
}
备注
Accepted to COLT 2019