中文

通用上下文老虎机模型选择的帕累托前沿

机器学习 2021-10-27 v1

摘要

模型选择的最新进展引发了关于这些技术基本极限的问题。受到具体审视的是具有嵌套策略类的通用上下文老虎机的模型选择,这构成了COLT2020的一个开放问题。它询问是否可能同时在嵌套策略类序列的所有策略上获得最优单一算法保证,或者否则是否可能在复杂度项与时间之间的权衡α[12,1)\alpha\in[\frac{1}{2},1)下实现:ln(Πm)1αTα\ln(|\Pi_m|)^{1-\alpha}T^\alpha。我们对此问题给出了令人失望的答案。即使在纯随机机制下,所需结果也是不可获得的。我们给出了直至对数因子的匹配上下界的帕累托前沿,从而证明对于通用策略类,独立于TT的复杂度项ln(Πm)\ln(|\Pi_m|)的增加是不可避免的。作为一个附带结果,我们也解决了COLT2016关于全信息博弈中二阶界的开放问题。

关键词

引用

@article{arxiv.2110.13282,
  title  = {The Pareto Frontier of model selection for general Contextual Bandits},
  author = {Teodor V. Marinov and Julian Zimmert},
  journal= {arXiv preprint arXiv:2110.13282},
  year   = {2021}
}