MuMiN:一个大规模多语言多模态事实核查误信息社交网络数据集
机器学习
2022-03-09 v2 计算与语言
计算机与社会
信息检索
社会与信息网络
摘要
误信息在社交媒体和新闻文章中正变得日益普遍。其传播已如此广泛,以至于我们需要利用机器学习进行算法辅助以检测此类内容。训练这些机器学习模型需要具备足够规模、多样性和质量的数据集。然而,自动误信息检测领域的数据集 predominantly 为单语、包含有限模态,且规模和质效不足。为此,我们开发了一个数据收集与链接系统(MuMiN-trawl),以构建一个公开误信息图数据集(MuMiN),其中包含丰富的社交媒体数据(推文、回复、用户、图像、文章、标签),涵盖属于 2.6 万个 Twitter 话题串的 2100 万条推文,每个话题串都在语义上链接到跨数十个主题、事件和领域、以 41 种语言撰写、跨度逾十年的 1.3 万条事实核查声明。该数据集通过 Python 包(mumin)以异构图形式提供。我们针对两个涉及社交媒体声明真实性的节点分类任务给出基线结果,并表明这些是具挑战性的任务,两个任务的最高宏平均 F1 分数分别为 62.55% 和 61.45%。MuMiN 生态系统可在 https://mumin-dataset.github.io/ 获取,包括数据、文档、教程和排行榜。
引用
@article{arxiv.2202.11684,
title = {MuMiN: A Large-Scale Multilingual Multimodal Fact-Checked Misinformation Social Network Dataset},
author = {Dan Saattrup Nielsen and Ryan McConville},
journal= {arXiv preprint arXiv:2202.11684},
year = {2022}
}
备注
9+3 pages