中文

受污染环境下的在线学习排序:一种鲁棒的级联赌博机方法

机器学习 2025-11-06 v1

摘要

在线学习排序研究如何从大量候选项中推荐一个短的排序列表,并根据用户点击改进未来的排序。该场景通常被建模为级联赌博机,其目标是最大化用户在尽可能多的时间步中至少点击一个展示项的可能性。然而,此类系统容易受到点击欺诈和其他操纵(即污染)的影响,其中机器人或付费点击农场注入有偏差的反馈,误导学习过程并降低用户体验。在本文中,我们提出了 MSUCB,一种鲁棒算法,它包含了一种新颖的中位数均值估计器,据我们所知,这是首次将其应用于带污染的赌博机设置。该估计器在没有污染时表现如同标准均值,因此无需为鲁棒性付出代价。在污染下,中位数步骤过滤掉异常值和污染样本,使估计值接近其真实值。在每一轮更新此估计值进一步加速了实验中的经验收敛。因此,MSUCB 在没有污染时实现了最优的对数遗憾,并在污染下优雅地退化,遗憾仅增加一个与总污染量相关的加性项。在真实世界数据集上的全面和广泛实验进一步表明,我们的方法在保持强鲁棒性的同时,始终优于先前的方法。特别是,与两种最先进的方法相比,它分别实现了 97.35% 和 91.60% 的遗憾改进。

关键词

引用

@article{arxiv.2511.03074,
  title  = {Online Learning to Rank under Corruption: A Robust Cascading Bandits Approach},
  author = {Fatemeh Ghaffari and Siddarth Sitaraman and Xutong Liu and Xuchuang Wang and Mohammad Hajiesmaili},
  journal= {arXiv preprint arXiv:2511.03074},
  year   = {2025}
}