中文

面向 Slate 推荐的分布式离策略评估

信息检索 2023-12-29 v2 人工智能 机器学习

摘要

推荐策略通常通过使用先前记录的数据进行评估,采用离策略评估方法来估计其预期性能。然而,对于向用户呈现多个项目 slate 的策略,由此产生的组合动作空间使得许多此类方法不切实际。先前的工作开发了利用 slate 结构来估计预期离策略性能的估计器,但对整个性能分布的估计仍然难以实现。估计完整分布允许对推荐策略进行更全面的评估,特别是在采用可从分布中计算的指标的风险和公平性轴上。在本文中,我们提出了一种针对 slate 的完整离策略性能分布的估计器,并确立了该估计器无偏且一致的条件。这建立在先前关于 slate 离策略评估和强化学习中离策略分布估计的工作之上。我们在合成数据以及由真实世界数据(MovieLens-20M)构建的 slate 推荐模拟器上实证验证了我们方法的有效性。我们的结果表明,在一系列 slate 结构中,与先前的工作相比,估计方差显著降低,样本效率得到提高。

关键词

引用

@article{arxiv.2308.14165,
  title  = {Distributional Off-Policy Evaluation for Slate Recommendations},
  author = {Shreyas Chaudhari and David Arbour and Georgios Theocharous and Nikos Vlassis},
  journal= {arXiv preprint arXiv:2308.14165},
  year   = {2023}
}

备注

Accepted in The 38th Annual AAAI Conference on Artificial Intelligence (AAAI-24)