中文

具有多样化用户偏好的在线学习

机器学习 2022-11-11 v4 机器学习

摘要

在本文中,我们研究了在随机多臂老虎机(MAB)框架下多样化用户偏好对学习的影响。我们旨在表明,当用户偏好足够多样化且每个臂对某些用户都是最优时,标准随机MAB设置下因探索次优臂而产生的O(log T)后悔可降至常数。我们的直觉是,为实现次线性后悔,最优臂被拉取的次数应随时间线性增长;当所有臂对某些用户都是最优且被频繁拉取时,臂的统计估计可快速收敛至其真实值,从而大幅降低探索需求。我们将该问题建模为随机线性老虎机模型,其中用户偏好和臂状态均被建模为独立同分布(i.i.d)的d维随机向量。在每个时隙开始时接收到用户偏好向量后,学习器拉取一个臂并获得由偏好向量与臂状态向量的线性乘积给出的奖励。我们还假设一旦拉取,被拉臂的状态即向学习器揭示。我们提出了一种加权上置信界(W-UCB)算法,并表明在用户偏好足够多样化时其可实现常数后悔。W-UCB在一般设置下的性能也得到了完整刻画,并通过合成数据进行了验证。

关键词

引用

@article{arxiv.1901.07924,
  title  = {Online Learning with Diverse User Preferences},
  author = {Chao Gan and Jing Yang and Ruida Zhou and Cong Shen},
  journal= {arXiv preprint arXiv:1901.07924},
  year   = {2022}
}

备注

Some data is missing