中文

SPICED:涵盖多主题与复杂度层级的新闻相似度检测数据集

计算与语言 2024-08-27 v3 机器学习

摘要

新闻媒体的激增增加了对能够检测新闻文章中冗余信息的智能系统的需求,以提升用户体验。然而,新闻的异质性可能导致这些系统中出现虚假结论:诸如一对新闻是否均关于政治之类的简单启发式方法可提供强劲但具欺骗性的下游性能。将新闻相似度数据集按主题分割,可迫使模型在更窄的域内学习区分显著特征,从而改进这些模型的训练。但这需要存在特定主题的数据集,而目前尚缺乏此类数据集。在本文中,我们提出一个新的相似新闻数据集SPICED,其包含七个主题:犯罪与法律、文化与娱乐、灾难与事故、经济与商业、政治与冲突、科学与技术以及体育。此外,我们提出了专为新闻相似度检测任务设计的四种不同复杂度层级。我们使用MinHash、BERT、SBERT和SimCSE模型对所创建的数据集进行了基准测试。

关键词

引用

@article{arxiv.2309.13080,
  title  = {SPICED: News Similarity Detection Dataset with Multiple Topics and Complexity Levels},
  author = {Elena Shushkevich and Long Mai and Manuel V. Loureiro and Steven Derby and Tri Kurniawan Wijaya},
  journal= {arXiv preprint arXiv:2309.13080},
  year   = {2024}
}

备注

10 pages. Accepted in LREC-COLING 2024