中文

MIND Your Language:面向跨语言新闻推荐的多语言数据集

信息检索 2024-03-27 v1

摘要

数字新闻平台使用新闻推荐器作为满足读者个性信息需求的主要手段。尽管在日益语言多样化的在线社区中,许多互联网用户消费多语言新闻,但大多数新闻推荐聚焦于主要资源丰富的语言,尤其是英语。此外,几乎所有新闻推荐工作都假设单语新闻消费,而越来越多的用户倾向于以至少两种语言消费信息。因此,现有的新闻推荐文献缺乏可催化开发在多语言环境中且适用于低资源语言的新闻推荐器的公开多语言基准数据集。为填补这一空白,我们引入 xMIND,一个源自英文 MIND 数据集并通过机器翻译衍生而来的开放式多语言新闻推荐数据集,覆盖 14 种语言学和地理上具有多样性的语言,数字足迹规模各异。使用 xMIND,我们系统性地对几种最新内容基于神经网络的新闻推荐器(NNRs)进行基准测试,考虑零样本(ZS-XLT)和少样本(FS-XLT)跨语言迁移场景,涵盖单语和双语新闻消费模式。我们的发现表明:(i) 当前 NNRs,即便基于多语言语言模型,也在 ZS-XLT 下存在显著性能损失;(ii) 在 FS-XLT 训练中包含目标语言数据对性能提升有限,尤其当结合双语新闻消费时。我们的发现因此需要更广泛的多语言和跨语言新闻推荐研究。xMIND 数据集可在 https://github.com/andreeaiana/xMIND 获取。

关键词

引用

@article{arxiv.2403.17876,
  title  = {MIND Your Language: A Multilingual Dataset for Cross-lingual News Recommendation},
  author = {Andreea Iana and Goran Glavaš and Heiko Paulheim},
  journal= {arXiv preprint arXiv:2403.17876},
  year   = {2024}
}

备注

Accepted at the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2024)