中文

CWRCzech:1亿查询-文档捷克点击数据集及其在网页相关性排序中的应用

信息检索 2024-07-16 v2 计算与语言

摘要

我们提出了CWRCzech,一个用于捷克语的点击网页排序数据集,包含1亿查询-文档捷克点击数据,以及从Seznam.cz搜索引擎日志中收集的用户行为数据。据我们所知,CWRCzech是迄今为止发布的最大规模的包含原始文本的点击数据集。它提供了文档在搜索结果中的位置以及用户行为信息:2760万个点击文档和1080万次停留时间。此外,我们还发布了一个手动标注的捷克语相关性测试集,包含近5万个查询-文档对,每个对至少由2名标注员标注。最后,我们分析了用户行为数据如何改善相关性排序,并表明在足够规模上自动获取数据训练的模型可以超越在人工标注数据上训练的模型的性能。CWRCzech以学术非商业许可发布,研究社区可在https://github.com/seznam/CWRCzech获取。

关键词

引用

@article{arxiv.2405.20994,
  title  = {CWRCzech: 100M Query-Document Czech Click Dataset and Its Application to Web Relevance Ranking},
  author = {Josef Vonášek and Milan Straka and Rostislav Krč and Lenka Lasoňová and Ekaterina Egorova and Jana Straková and Jakub Náplava},
  journal= {arXiv preprint arXiv:2405.20994},
  year   = {2024}
}

备注

Accepted to SIGIR 2024