具有错误指定用户模型的Bandit在线聚类
机器学习
2023-10-11 v2 人工智能
摘要
上下文线性bandit是一个重要的在线学习问题,给定臂特征后,学习智能体在每一轮选择一个臂以长期最大化累积奖励。一类称为bandit聚类(CB)的工作利用了用户偏好上的协作效应,并显示出比经典线性bandit算法显著的改进。然而,现有CB算法需要良好指定的线性用户模型,当这一关键假设不成立时可能失效。能否针对具有错误指定用户模型的更实际场景设计鲁棒CB算法仍是一个开放问题。在本文中,我们首次提出具有错误指定用户模型的bandit聚类(CBMUM)这一重要问题,其中用户模型中的期望奖励可偏离完美线性模型。我们设计了两种鲁棒CB算法RCLUMB和RSCLUMB(分别用动态图和集合表示学到的聚类结构),能够适应由模型错误指定导致的不准确用户偏好估计和错误聚类。我们在比先前CB工作更弱的假设下(值得注意的是,我们去掉了关于臂分布的一个限制性技术假设)证明了算法遗憾上界为,该上界在的对数因子内渐近匹配下界,并在若干退化情形下匹配最优结果。证明由用户误聚类引起的遗憾的技术相当通用,可能具有独立意义。在合成和真实数据上的实验表明我们的算法优于先前算法。
引用
@article{arxiv.2310.02717,
title = {Online Clustering of Bandits with Misspecified User Models},
author = {Zhiyong Wang and Jize Xie and Xutong Liu and Shuai Li and John C. S. Lui},
journal= {arXiv preprint arXiv:2310.02717},
year = {2023}
}