上反事实置信界:上下文多臂老虎机中的一种新乐观原则
机器学习
2024-03-12 v4 统计理论
机器学习
统计理论
摘要
面对不确定性时保持乐观的原则是多臂老虎机和强化学习中最广泛使用和最成功的思想之一。然而,现有的乐观算法(主要是 UCB 及其变体)往往难以处理一般函数类和大型上下文空间。在本文中,我们研究带有离线回归预言机的通用上下文老虎机,并提出一种简单、通用的设计乐观算法的原则,称为“上反事实置信界”(UCCB)。UCCB 的关键创新在于在策略空间中而非像 UCB 那样在动作空间中构建置信界。我们证明这些算法在处理一般函数类和大型上下文空间时是理论最优且计算高效的。此外,我们说明 UCCB 原则可无缝扩展到无限动作通用上下文老虎机,并在使用离线回归预言机时首次给出这些设定下的解决方案。
引用
@article{arxiv.2007.07876,
title = {Upper Counterfactual Confidence Bounds: a New Optimism Principle for Contextual Bandits},
author = {Yunbei Xu and Assaf Zeevi},
journal= {arXiv preprint arXiv:2007.07876},
year = {2024}
}