奖励优化推荐系统的离线评估:以仿真为例
信息检索
2022-09-20 v1 人工智能
机器学习
摘要
在学术与工业研究中,在线评估方法被视为推荐系统等交互式应用的黄金标准。自然,原因在于我们可直接度量依赖干预(即展示给用户的推荐)的效用指标。然而,在线评估方法因多种原因成本高昂,对可靠离线评估流程的需求依然明确。工业界常将离线指标作为一线评估,以生成待在线评估的有前景候选模型。学术工作中,对在线系统的有限访问使离线指标成为验证新方法的事实手段。存在两类离线指标:基于代理的方法与反事实方法。第一类常与我们在意的在线指标相关性差,第二类仅能在真实环境无法满足的假设下提供理论保证。此处,我们主张基于仿真的比较提供了超越离线指标的前进路径,并论证其为更优的评估手段。
引用
@article{arxiv.2209.08642,
title = {Offline Evaluation of Reward-Optimizing Recommender Systems: The Case of Simulation},
author = {Imad Aouali and Amine Benhalloum and Martin Bompaire and Benjamin Heymann and Olivier Jeunen and David Rohde and Otmane Sakhi and Flavian Vasile},
journal= {arXiv preprint arXiv:2209.08642},
year = {2022}
}
备注
Accepted at the ACM RecSys 2021 Workshop on Simulation Methods for Recommender Systems