无限臂线性上下文老虎机的紧后悔界
机器学习
2021-01-28 v3 机器学习
摘要
线性上下文老虎机是一类重要的序贯决策问题,在推荐系统、在线广告、医疗健康以及许多其他机器学习相关任务中有广泛应用。尽管已有大量先前研究,具有无限动作集的线性上下文老虎机的紧后悔界仍属开放问题。本文通过考虑具有(变化的)无限动作集的线性上下文老虎机来解决这一开放问题。我们证明了阶数为的后悔上界,其中为域维度,为时间范围。我们的上界与[Li et al., 2019]中已有的下界仅相差迭代对数项。
引用
@article{arxiv.1905.01435,
title = {Tight Regret Bounds for Infinite-armed Linear Contextual Bandits},
author = {Yingkai Li and Yining Wang and Xi Chen and Yuan Zhou},
journal= {arXiv preprint arXiv:1905.01435},
year = {2021}
}
备注
10 pages, accepted for presentation at AISTATS 2021