一个来自世界各地的多样化多语言新闻标题数据集
计算与语言
2024-03-29 v1
摘要
Babel Briefings 是一个新颖的数据集,包含 2020 年 8 月至 2021 年 11 月期间来自全球 30 种语言和 54 个地点的 470 万条新闻标题,并包含所有文章的英文翻译。该数据集专为自然语言处理和媒体研究而设计,可作为训练或评估语言模型的高质量数据集,同时也提供了一个简单易用的文章集合,例如用于分析全球新闻报道和文化叙事。作为该数据集所支持分析的简单演示,我们使用基于 TF-IDF 加权相似度指标的基本流程,将文章聚类为关于同一事件的簇。然后,我们可视化该事件的 \emph{事件签名},展示哪些语言的文章随时间出现,揭示了基于事件邻近度和事件不可预见性的直观特征。该数据集可在 Kaggle 和 HuggingFace 上获取,并附有 GitHub 代码。
引用
@article{arxiv.2403.19352,
title = {A diverse Multilingual News Headlines Dataset from around the World},
author = {Felix Leeb and Bernhard Schölkopf},
journal= {arXiv preprint arXiv:2403.19352},
year = {2024}
}
备注
Published in NAACL 2024 Proceedings (Short Paper track)