中文

面向联邦在线排序的大规模 Web 搜索数据集

信息检索 2025-08-19 v1 人工智能 分布式、并行与集群计算

摘要

集中收集搜索交互日志以训练排序模型会引发重大的隐私问题。联邦在线学习排序 (FOLTR) 通过在不共享原始用户数据的情况下实现协作模型训练,提供了一种隐私保护的替代方案。然而,FOLTR 中的基准数据集主要基于经典学习排序数据集的随机分区、模拟用户点击,以及同步客户端参与的假设,这些假设过于简化,削弱了实验结果的现实性。我们提出 AOL4FOLTR,一个来自 10,000 用户、包含 260 万查询的大规模 Web 搜索数据集。我们的数据集通过包括用户标识、真实点击数据和查询时间戳,实现了真实的用户分区、行为建模和异步联邦学习场景,解决了现有基准数据集的关键局限性。

关键词

引用

@article{arxiv.2508.12353,
  title  = {A Large-Scale Web Search Dataset for Federated Online Learning to Rank},
  author = {Marcel Gregoriadis and Jingwei Kang and Johan Pouwelse},
  journal= {arXiv preprint arXiv:2508.12353},
  year   = {2025}
}

备注

Accepted at CIKM 2025