偏好会演化,你的Bandit算法也应如此:面向在线平台的状态演化Bandit
机器学习
2025-01-29 v5 人工智能
计算机科学与博弈论
摘要
我们提出了一种在bandit反馈下学习并考虑确定性演化且不可观测状态的模型,称为确定性演化状态Bandit(-)。我们模型的主要应用场景是推荐系统学习与在线广告学习。在这两种情况下,算法在每轮获得的奖励是所选择动作的短期奖励与系统“健康度”(即由其状态衡量)的函数。例如,在推荐系统中,平台从用户对某类内容的参与中获得的奖励不仅取决于该具体内容的内在特征,还取决于用户偏好因与平台上其他类型内容交互而产生的演化。我们的通用模型考虑了状态演化的不同速率 (例如用户偏好因先前内容消费而转移的快慢),并将标准多臂bandit作为特例涵盖。算法的目标是最小化相对于最佳固定臂序列的某种后悔值,这比标准情形下事后最佳固定动作的基准更难实现。我们给出了适用于任意演化速率 的在线学习算法,并展示了我们的结果对各种模型误设的鲁棒性。
引用
@article{arxiv.2307.11655,
title = {Preferences Evolve And So Should Your Bandits: Bandits with Evolving States for Online Platforms},
author = {Khashayar Khosravi and Renato Paes Leme and Chara Podimata and Apostolis Tsorvantzis},
journal= {arXiv preprint arXiv:2307.11655},
year = {2025}
}