中文

离线推荐评估中抽样策略的可靠性

信息检索 2025-08-12 v2 机器学习

摘要

离线评估是衡量推荐系统性能的核心方法,当在线测试不切实际或风险较大时尤为重要。然而,这受到两个关键偏差来源的影响:暴露偏差(用户仅与他们看到的物品交互),以及抽样偏差(当评估在 logged 物品子集上进行而非完整目录时引入)。尽管已有研究提出了缓解抽样偏差的方法,但这些方法通常在固定的 logged 数据集上评估,而非针对在不同暴露条件下或相对于真实用户偏好方面的可靠模型比较能力。在本文中,我们研究了不同的 logging 和抽样选择组合如何影响离线评估的可靠性。我们以完全观测数据集作为 ground truth,系统性地模拟多样化的暴露偏差,并沿四个维度评估常见抽样策略:抽样分辨率(推荐模型可分离性)、保真度(与完整评估的一致性)、鲁棒性(在暴露偏差下的稳定性)以及预测能力(与 ground truth 的一致性)。我们的发现揭示了抽样如何扭曲评估结果,并为选择能产生可靠且稳健离线比较的策略提供了实用指导。

关键词

引用

@article{arxiv.2508.05398,
  title  = {On the Reliability of Sampling Strategies in Offline Recommender Evaluation},
  author = {Bruno L. Pereira and Alan Said and Rodrygo L. T. Santos},
  journal= {arXiv preprint arXiv:2508.05398},
  year   = {2025}
}

备注

Accepted to RecSys 2025