中文

通过插值物品-位置模型与基于位置模型进行学习排序的离屏策略评估

机器学习 2022-10-19 v1 信息检索 统计计算

摘要

工业推荐系统的一个关键需求是在部署推荐策略至生产环境之前能够离线评估它们。不幸的是,广泛使用的离屏策略评估方法要么对用户行为做出强假设从而导致过大偏差,要么做出较少假设却面临巨大方差。我们通过开发一种新的估计器来解决此问题,该估计器缓解了两种最流行的排序离屏策略估计器的问题,即基于位置模型和物品-位置模型。具体而言,称为INTERPOL的新估计器解决了可能被错误设定的基于位置模型的偏差,同时相比物品-位置模型提供了可适应的偏差-方差权衡。我们提供了理论论证以及突出我们新颖评估方法性能的实证结果。

关键词

引用

@article{arxiv.2210.09512,
  title  = {Off-policy evaluation for learning-to-rank via interpolating the item-position model and the position-based model},
  author = {Alexander Buchholz and Ben London and Giuseppe di Benedetto and Thorsten Joachims},
  journal= {arXiv preprint arXiv:2210.09512},
  year   = {2022}
}

备注

Presented at CONSEQUENCES workshop (Recsys '22) https://sites.google.com/view/consequences2022/contributions