中文

通过嵌入空间用户行为建模的排序策略离策略评估

机器学习 2025-06-03 v1 机器学习

摘要

在具有大排序动作空间的排序设定下,由于唯一动作数量和排序长度的增加而产生的离策略评估(OPE),对于仅使用先前版本的记录 bandit 数据来评估新推荐策略至关重要。为了解决现有估计器相关的高方差问题,我们引入了两个新假设:对排序无直接效应和排序嵌入空间上的用户行为模型。然后,我们提出了广义边际化逆倾向得分(GMIPS)估计器,与现有估计器相比具有统计上理想的性质。最后,我们证明了 GMIPS 实现了最低的均方误差(MSE)。值得注意的是,在 GMIPS 变体中,边际化奖励交互 IPS(MRIPS)结合了基于排序嵌入上级联行为假设的双重边际化重要性权重。正如我们的实验所证明的,即使排序动作空间增加且上述假设可能不成立,MRIPS 仍能有效平衡偏差与方差之间的权衡。

关键词

引用

@article{arxiv.2506.00446,
  title  = {Off-Policy Evaluation of Ranking Policies via Embedding-Space User Behavior Modeling},
  author = {Tatsuki Takahashi and Chihiro Maru and Hiroko Shoji},
  journal= {arXiv preprint arXiv:2506.00446},
  year   = {2025}
}