中文

Epsilon 贪心:基于均匀数据的上下文老虎机方法实现无偏推荐

机器学习 2023-10-10 v1

摘要

推荐系统通常采用连续训练,导致系统偏向其先前推荐的自反馈循环偏差。近期研究试图通过收集少量无偏数据来缓解此偏差。尽管这些研究已成功开发出偏差较小的模型,但它们忽略了一个关键事实:模型生成的推荐会作为后续训练阶段的训练数据。为解决此问题,我们提出一个框架,利用少量均匀收集的数据学习无偏估计量,并专注于为后续训练迭代生成改进的训练数据。为此,我们将推荐视为上下文多臂老虎机问题,并强调探索模型了解有限的物品。我们引入了一种新的离线顺序训练模式,模拟推荐系统中真实世界的连续训练场景,为研究自反馈偏差提供了更合适的框架。通过使用所提出的训练模式进行大量实验,我们证明了我们的模型优于最先进的去偏方法。

关键词

引用

@article{arxiv.2310.04855,
  title  = {Epsilon non-Greedy: A Bandit Approach for Unbiased Recommendation via Uniform Data},
  author = {S. M. F. Sani and Seyed Abbas Hosseini and Hamid R. Rabiee},
  journal= {arXiv preprint arXiv:2310.04855},
  year   = {2023}
}