中文

Amazon-M2:面向推荐与文本生成的多语言多地区购物会话数据集

信息检索 2023-10-20 v2 人工智能 机器学习

摘要

对用户购物意图建模是电子商务中的关键任务,因其直接影响用户体验与参与度。因此,准确理解用户偏好对于提供个性化推荐至关重要。基于会话的推荐利用用户会话数据预测其下一次交互,已变得日益流行。然而,现有会话数据集在商品属性、用户多样性和数据集规模方面存在局限,因而无法全面捕捉用户行为与偏好的谱系。为弥补这一差距,我们提出 Amazon 多语言多地区购物会话数据集,即 Amazon-M2。它是首个由来自六个不同地区的数百万用户会话构成的多语言数据集,其中商品的主要语言为英语、德语、日语、法语、意大利语和西班牙语。值得注意的是,该数据集可帮助我们增强个性化与用户偏好理解,惠及多种现有任务并赋能新任务。为检验数据集潜力,我们在本工作中引入三项任务:(1) 下一商品推荐,(2) 带领域偏移的下一商品推荐,以及 (3) 下一商品标题生成。基于上述任务,我们在所提数据集上基准测试了一系列算法,得出供进一步研究与实践的新见解。此外,基于所提数据集与任务,我们在 KDD CUP 2023 举办了竞赛,吸引了数千名用户与提交。获胜方案及相关研讨会可在我们的网站 https://kddcup23.github.io/ 访问。

关键词

引用

@article{arxiv.2307.09688,
  title  = {Amazon-M2: A Multilingual Multi-locale Shopping Session Dataset for Recommendation and Text Generation},
  author = {Wei Jin and Haitao Mao and Zheng Li and Haoming Jiang and Chen Luo and Hongzhi Wen and Haoyu Han and Hanqing Lu and Zhengyang Wang and Ruirui Li and Zhen Li and Monica Xiao Cheng and Rahul Goutam and Haiyang Zhang and Karthik Subbian and Suhang Wang and Yizhou Sun and Jiliang Tang and Bing Yin and Xianfeng Tang},
  journal= {arXiv preprint arXiv:2307.09688},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023, Track on Datasets and Benchmarks; Dataset for KDD Cup 2023, https://kddcup23.github.io/