中文

基于暴露风险最小化的反事实学习排序的安全部署

信息检索 2023-05-03 v1 机器学习

摘要

反事实学习排序(CLTR)依赖于基于暴露的逆倾向得分(IPS),这是 IPS 针对排序任务的特化改编,用于纠正位置偏差。尽管 IPS 能提供无偏且一致的估计,却常受高方差困扰。尤其在可用点击数据很少时,该方差会导致 CLTR 学到次优排序行为。因此,现有 CLTR 方法伴随显著风险,因为直接部署其模型可能导致极差的用户体验。我们提出一种具有安全部署理论保证的新颖风险感知 CLTR 方法。我们将一种新颖的基于暴露的风险正则化概念应用于 LTR 的 IPS 估计。我们的风险正则化惩罚学习模型与给定安全模型之间排序行为的失配。从而在 IPS 估计高度不确定时,确保学习到的排序模型接近可信模型,大幅降低部署风险。实验结果证明了所提方法的有效性:在少量数据时避免初期糟糕表现,同时在收敛时保持高性能。对于 CLTR 领域,我们新颖的基于暴露的风险最小化方法使从业者能更安全地采用 CLTR,缓解以往方法的诸多风险。

关键词

引用

@article{arxiv.2305.01522,
  title  = {Safe Deployment for Counterfactual Learning to Rank with Exposure-Based Risk Minimization},
  author = {Shashank Gupta and Harrie Oosterhuis and Maarten de Rijke},
  journal= {arXiv preprint arXiv:2305.01522},
  year   = {2023}
}

备注

SIGIR 2023 - Full paper