中文

向量成本的在线学习与带背包的赌博机

机器学习 2020-10-19 v1 数据结构与算法 计算机科学与博弈论

摘要

我们引入向量成本在线学习(\OLVCp),其中在每个时间步 t{1,,T}t \in \{1,\ldots, T\},我们需要选择一个动作 i{1,,n}i \in \{1,\ldots,n\},该动作产生 [0,1]d[0,1]^{d} 中未知的向量成本。在线算法的目标是最小化其成本向量之和的 p\ell_p 范数。这涵盖了 d=1d=1 时的经典在线学习设定,而对于一般 dd 因其应用(如我们希望在不同机器(维度)间平衡负载的在线调度)而颇具意义。我们在随机与对抗到达两种设定下研究 \OLVCp,并给出将问题从 dd 维约简至单维的通用过程。这使我们能在全反馈与赌博机反馈模型中使用经典在线学习算法以获得(近)最优结果。特别地,我们得到一个(除学习率选择外)单一算法,对随机到达给出亚线性后悔,对对抗到达给出紧的 O(min{p,logd})O(\min\{p, \log d\}) 竞争比。\OLVCp 问题也是试图求解流行的带背包的赌博机(\BwK)问题时自然出现的子问题。该联系使我们能运用 \OLVCp 技术,在随机与对抗设定下为 \BwK 获得(近)最优结果。特别地,我们对对抗 \BwK 获得了紧的 O(logdlogT)O(\log d \cdot \log T) 竞争比算法,改进了 Immorlica 等人 [FOCS'19] 的 O(dlogT)O(d \cdot \log T) 竞争比算法。

关键词

引用

@article{arxiv.2010.07346,
  title  = {Online Learning with Vector Costs and Bandits with Knapsacks},
  author = {Thomas Kesselheim and Sahil Singla},
  journal= {arXiv preprint arXiv:2010.07346},
  year   = {2020}
}

备注

Preliminary version appeared in COLT 2020