面向联邦在线排序的大规模 Web 搜索数据集
信息检索
2025-08-19 v1 人工智能
分布式、并行与集群计算
摘要
集中收集搜索交互日志以训练排序模型会引发重大的隐私问题。联邦在线学习排序 (FOLTR) 通过在不共享原始用户数据的情况下实现协作模型训练,提供了一种隐私保护的替代方案。然而,FOLTR 中的基准数据集主要基于经典学习排序数据集的随机分区、模拟用户点击,以及同步客户端参与的假设,这些假设过于简化,削弱了实验结果的现实性。我们提出 AOL4FOLTR,一个来自 10,000 用户、包含 260 万查询的大规模 Web 搜索数据集。我们的数据集通过包括用户标识、真实点击数据和查询时间戳,实现了真实的用户分区、行为建模和异步联邦学习场景,解决了现有基准数据集的关键局限性。
引用
@article{arxiv.2508.12353,
title = {A Large-Scale Web Search Dataset for Federated Online Learning to Rank},
author = {Marcel Gregoriadis and Jingwei Kang and Johan Pouwelse},
journal= {arXiv preprint arXiv:2508.12353},
year = {2025}
}
备注
Accepted at CIKM 2025