中文

是时候拆分了:探索序列推荐器离线评估的数据划分策略

信息检索 2025-08-11 v1 机器学习

摘要

现代序列推荐系统,从轻量级的基于 Transformer 的变体到大语言模型,由于其在下一项预测任务中的出色表现,在学术界和工业界变得越来越重要。然而,序列推荐的常见评估协议仍然发展不足:它们通常无法准确反映相应的推荐任务,或与现实场景不一致。尽管广泛使用的留一法划分与下一项预测相匹配,但它允许训练期和测试期之间的重叠,这会导致时间泄露和不切实际的长测试期,限制了现实相关性。全局时间划分通过在不同的未来时期进行评估来解决这些问题。然而,它在序列推荐中的应用仍然定义松散,特别是在选择目标交互和构建在验证和测试指标之间提供必要一致性的验证子集方面。在本文中,我们证明了评估结果在不同的划分策略之间可能存在显著差异,从而影响模型排名和实际部署决策。为了提高学术界和工业界的可复现性,我们在多个数据集和已建立的基线上系统地比较了序列推荐的不同划分策略。我们的发现表明,流行的划分(如留一法)可能与更现实的评估策略不够一致。代码:https://github.com/monkey0head/time-to-split

关键词

引用

@article{arxiv.2507.16289,
  title  = {Time to Split: Exploring Data Splitting Strategies for Offline Evaluation of Sequential Recommenders},
  author = {Danil Gusak and Anna Volodkevich and Anton Klenitskiy and Alexey Vasilev and Evgeny Frolov},
  journal= {arXiv preprint arXiv:2507.16289},
  year   = {2025}
}

备注

Accepted for ACM RecSys 2025. Author's version. The final published version will be available at the ACM Digital Library