中文

赌博机与强化学习中模型选择的遗憾界平衡与淘汰法

机器学习 2020-12-25 v1 人工智能 机器学习 其他统计学

摘要

我们针对随机赌博机与强化学习问题中的算法提出一种简单的模型选择方法。与先前(隐式)假设已知最优遗憾界的工作不同,我们仅要求每个基算法附带一个候选遗憾界,该界在所有轮次中可能成立也可能不成立。在每轮中,我们的方法运行某一基算法以保持所有剩余基算法的候选遗憾界平衡,并淘汰违背其候选界的算法。我们证明,该方法的总遗憾界由最优有效候选遗憾界乘以一个乘性因子所界定。该因子在若干应用中合理较小,包括具有嵌套函数类的线性赌博机与 MDP、未知误指定线性赌博机,以及应用于不同置信参数线性赌博机的 LinUCB。我们进一步表明,在合适的间隙假设下,当轮次足够大时,该因子仅随基算法数量而非其复杂度缩放。最后,与近期线性随机赌博机模型选择研究不同,我们的方法足够通用,亦可覆盖上下文信息由对抗环境而非随机环境生成的情形。

关键词

引用

@article{arxiv.2012.13045,
  title  = {Regret Bound Balancing and Elimination for Model Selection in Bandits and RL},
  author = {Aldo Pacchiano and Christoph Dann and Claudio Gentile and Peter Bartlett},
  journal= {arXiv preprint arXiv:2012.13045},
  year   = {2020}
}

备注

57 pages