后续上下文同样重要:通过服务后上下文改进上下文_bandits
机器学习
2023-09-26 v1 机器学习
摘要
标准上下文_bandit 问题假设所有相关上下文都在算法选择臂之前被观测到。这一建模范式虽有裨益,但在处理选择臂后才能观测到有价值附加上下文的问题时往往不足。例如,Youtube、Instagram、Tiktok 等内容推荐平台在推荐后也会观测到与用户奖励相关的有价值后续信息(例如用户停留时长、观看速度等)。为提升这些应用中的在线学习效率,我们研究了一种带有服务后上下文的新颖上下文_bandit 问题,并设计了一种新算法 poLinUCB,其在标准假设下达到紧致后悔界。我们技术证明的核心是对著名的椭球势引理(EPL)的鲁棒化与推广版本,其可容纳数据中的噪声。此种鲁棒化对处理我们的问题是必要的,且我们相信它也具有普遍意义。在合成与真实世界数据集上的大量实证测试展示了利用服务后上下文的显著益处,以及我们的算法相对于最先进方法的优越性能。
引用
@article{arxiv.2309.13896,
title = {Follow-ups Also Matter: Improving Contextual Bandits via Post-serving Contexts},
author = {Chaoqi Wang and Ziyu Ye and Zhe Feng and Ashwinkumar Badanidiyuru and Haifeng Xu},
journal= {arXiv preprint arXiv:2309.13896},
year = {2023}
}
备注
NeurIPS 2023 (Spotlight)