论高维下 Thompson 采样的次优性
机器学习
2021-10-22 v2 机器学习
摘要
在本文中,我们考虑用于组合半 bandit 的 Thompson 采样(TS)。我们证明,或许令人惊讶的是,TS 对于该问题而言是次优的,因为其遗憾(regret)随环境维度呈指数级缩放,且其极大极小遗憾(minimax regret)几乎呈线性缩放。这一现象在多种假设下发生,包括非线性和线性奖励函数,以及伯努利分布奖励与均匀先验。我们还表明,向 TS 中加入固定量的强制探索并不能缓解该问题。我们以数值结果补充理论结果,并表明在实践中 TS 确实在某些高维情形下表现非常糟糕。
关键词
引用
@article{arxiv.2102.05502,
title = {On the Suboptimality of Thompson Sampling in High Dimensions},
author = {Raymond Zhang and Richard Combes},
journal= {arXiv preprint arXiv:2102.05502},
year = {2021}
}
备注
Neurips 2021 - 34 pages