中文

论高维下 Thompson 采样的次优性

机器学习 2021-10-22 v2 机器学习

摘要

在本文中,我们考虑用于组合半 bandit 的 Thompson 采样(TS)。我们证明,或许令人惊讶的是,TS 对于该问题而言是次优的,因为其遗憾(regret)随环境维度呈指数级缩放,且其极大极小遗憾(minimax regret)几乎呈线性缩放。这一现象在多种假设下发生,包括非线性和线性奖励函数,以及伯努利分布奖励与均匀先验。我们还表明,向 TS 中加入固定量的强制探索并不能缓解该问题。我们以数值结果补充理论结果,并表明在实践中 TS 确实在某些高维情形下表现非常糟糕。

关键词

引用

@article{arxiv.2102.05502,
  title  = {On the Suboptimality of Thompson Sampling in High Dimensions},
  author = {Raymond Zhang and Richard Combes},
  journal= {arXiv preprint arXiv:2102.05502},
  year   = {2021}
}

备注

Neurips 2021 - 34 pages