中文

面向高级反事实学习排序的实用且稳健的安全保证

机器学习 2024-08-08 v2 信息检索

摘要

反事实学习排序(CLTR)可能存在风险,在各种情况下会产生次优模型,导致部署时性能受损。为此提出了安全 CLTR 以抵消位置偏差中的逆倾角度计分。然而,现有的 CLTR 安全措施不适用于最先进的 CLTR 方法,无法处理信任偏差,且依赖于用户行为的特定假设。我们的贡献有两个方面:首先,我们推广了现有的安全 CLTR 方法,使其适用于最先进的双稳健 CLTR 和信任偏差;其次,我们提出一种新方法,proximal ranking policy optimization(PRPO),在不依赖用户行为假设的情况下提供部署中的安全性。PRPO 消除了学习排序行为过于不像安全排序模型的激励,从而在不依赖任何特定用户假设的情况下,对学习模型对性能指标的潜在降低程度施加限制。我们的实验表明,我们的 novel 安全双稳健方法和 PRPO 的性能优于现有的安全逆倾角度计分方法。然而,在意外情况下,安全双稳健方法可能变得不安全并造成性能损失。相比之下,PRPO 始终保持安全,即使在最大对抗情况下也能做到。通过避免假设,PRPO 是首个在部署中实现无条件安全的方法,这 translates to robust safety for real-world applications。

关键词

引用

@article{arxiv.2407.19943,
  title  = {Practical and Robust Safety Guarantees for Advanced Counterfactual Learning to Rank},
  author = {Shashank Gupta and Harrie Oosterhuis and Maarten de Rijke},
  journal= {arXiv preprint arXiv:2407.19943},
  year   = {2024}
}

备注

Accepted as full paper at CIKM 2024