上下文可以很廉价:用线性老虎机算法求解随机上下文老虎机问题
机器学习
2023-05-30 v2 机器学习
摘要
在本文中,我们研究了随机上下文线性老虎机问题,其中决策者被提供一个上下文(从分布中抽取的随机动作集合)。每个动作的期望奖励由该动作与一个未知参数的内积指定。目标是在经过多次动作执行后,设计一种算法使其学习到的策略尽可能接近未知的最佳策略。这个问题被认为比线性老虎机问题更具挑战性,后者可以被视为具有固定上下文的上下文老虎机问题。令人惊讶的是,在本文中,我们表明随机上下文问题可以像线性老虎机问题一样求解。具体而言,我们建立了一个新的归约框架,在上下文分布已知时,将每个随机上下文线性老虎机实例转化为线性老虎机实例。当上下文分布未知时,我们建立了一种算法,将随机上下文实例转化为一系列具有微小误设定的线性老虎机实例,并实现了与求解误设定线性老虎机实例的算法几乎相同的最坏情况遗憾界。因此,我们的结果意味着上下文线性老虎机具有 的高概率遗憾界,在解决 (Li et al., 2019)、(Li et al., 2021) 中的开放问题方面取得了进展。我们的归约框架为处理随机上下文线性老虎机问题开辟了一条新途径,并在包括批处理设置、具有误设定的上下文老虎机、具有稀疏未知参数的上下文老虎机以及具有对抗性破坏的上下文老虎机在内的多个实例中实现了改进的遗憾界。
引用
@article{arxiv.2211.05632,
title = {Contexts can be Cheap: Solving Stochastic Contextual Bandits with Linear Bandit Algorithms},
author = {Osama A. Hanna and Lin F. Yang and Christina Fragouli},
journal= {arXiv preprint arXiv:2211.05632},
year = {2023}
}