中文

在线知识共享中的大规模富上下文查询与推荐数据集

信息检索 2021-06-14 v1

摘要

数据在机器学习研究中起着至关重要的作用。在推荐研究中,用户行为与侧信息均有助于对用户建模。因此,具有丰富用户行为的大规模真实场景数据集将大有裨益。然而,此类数据集不易获取,因为大多数仅由公司持有并保护。本文提出一个从知识共享平台收集的新大规模数据集,其包含 10 天内收集的约 1 亿次交互、798K 用户、165K 问题、554K 回答、240K 作者、70K 话题以及超过 501K 用户查询关键词。其中亦包含对用户、回答、问题、作者与话题的匿名描述。需注意,每个用户最新的查询关键词未包含于以往开放数据集中,其揭示了用户的显式信息需求。我们对该数据集进行刻画,并展示其在推荐研究中的潜在应用。多项实验表明该数据集可用于评估通用 Top-N 推荐、序列推荐与上下文感知推荐中的算法。该数据集亦可被用于整合搜索与推荐,以及带负反馈的推荐。此外,推荐之外的任务,如用户性别预测、最具价值回答者识别与高质量回答识别,也可使用该数据集。据我们所知,这是用于个性化推荐的最大真实世界交互数据集。

关键词

引用

@article{arxiv.2106.06467,
  title  = {A Large-Scale Rich Context Query and Recommendation Dataset in Online Knowledge-Sharing},
  author = {Bin Hao and Min Zhang and Weizhi Ma and Shaoyun Shi and Xinxing Yu and Houzhi Shan and Yiqun Liu and Shaoping Ma},
  journal= {arXiv preprint arXiv:2106.06467},
  year   = {2021}
}

备注

7 pages