中文

揭示线性多臂老虎机推荐系统离线评估中的探索-利用偏差

机器学习 2026-04-20 v2 信息检索

摘要

多臂老虎机(MAB)算法在需要持续、增量学习的推荐系统中广泛应用。MAB的核心方面是探索-利用权衡:在可能被喜欢的项目之间选择,或探索新项目以收集信息。在情境线性老虎机中,这一权衡尤为关键,因为许多变体共享相同的线性回归底层结构,主要区别在于其探索策略。尽管其应用广泛,但对MAB的离线评估日益被认识到在可靠评估探索行为方面存在局限。本研究对几种线性MAB进行了大规模离线经验比较。令人惊讶的是,在超过90%的各种数据集上,带有无探索类型的贪心线性模型始终实现最佳性能,常常优于或相当于其探索性对手。这一观察得到超参数优化的进一步支撑,该优化始终偏好最小化探索的配置,表明在这些评估设置中,纯利用是主导策略。我们的结果揭示了针对老虎机离线评估协议的严重不足,特别是其无法真实反映探索效能的能力。Consequently,本研究强调了迫切需要 developing more robust assessment methodologies, which guides future investigations into alternative evaluation frameworks for interactive learning in recommender systems.

关键词

引用

@article{arxiv.2507.18756,
  title  = {Exploitation Over Exploration: Unmasking the Bias in Linear Bandit Recommender Offline Evaluation},
  author = {Pedro R. Pires and Gregorio F. Azevedo and Pietro L. Campos and Rafael T. Sereicikas and Tiago A. Almeida},
  journal= {arXiv preprint arXiv:2507.18756},
  year   = {2026}
}

备注

Published in RecSys'25, 10 pages, 3 figures