中文

对决型多臂老虎机的在线聚类

机器学习 2025-02-05 v1 人工智能

摘要

情境多臂老虎机 (MAB) 是一种广泛用于需要在不确定性下进行顺序决策的问题的框架,例如推荐系统。在大量用户参与的应用中,通过促进多个用户之间的协作可显著提高情境 MAB 的性能。这通过对老虎机进行聚类 (CB) 方法实现,将用户自适应分组到不同的聚类中,并通过允许同一聚类中的用户共享数据来实现协作。然而,经典的 CB 算法通常依赖于数值奖励反馈,而在某些实际应用中可能并不实用。例如,在推荐系统中,更真实可靠的是对推荐的项目两两间的偏好反馈,而非绝对奖励。为此,我们引入了首个“对决型老虎机聚类算法”,以基于偏好反馈实现协作决策。我们提出了两种新算法:(1) 线性对决型老虎机聚类 (COLDB),将用户奖励函数建模为上下文向量的线性函数;(2) 神经网络对决型老虎机聚类 (CONDB),使用神经网络建模复杂的非线性用户奖励函数。两种算法都得到严格的理论分析,表明用户协作导致更好的警戒下界。广泛的实验在合成数据和真实数据集上进一步验证了方法的有效性,确立了其在涉及多个用户且基于偏好反馈的实际应用中的潜力。

关键词

引用

@article{arxiv.2502.02079,
  title  = {Online Clustering of Dueling Bandits},
  author = {Zhiyong Wang and Jiahang Sun and Mingze Kong and Jize Xie and Qinghua Hu and John C. S. Lui and Zhongxiang Dai},
  journal= {arXiv preprint arXiv:2502.02079},
  year   = {2025}
}

备注

Preprint