POLygraph:波兰假新闻数据集
计算与语言
2024-07-02 v1
摘要
本文提出了 POLygraph 数据集,这是一个独特的波兰语假新闻检测资源。数据集由一个 cross-disciplinary team 创建,包含两个部分:'fake-or-not' 数据集包含 11,360 对新闻文章(通过其 URL 标识)及其标签,'fake-they-say' 数据集包含 5,082 篇新闻文章(通过其 URL 标识)及其评论推文。与现有数据集不同,POLygraph 涵盖了来自 source literature 的各种方法,为假新闻检测提供了全面的资源。该数据通过 expert 和 non-expert 标注员进行 manual annotation。该项目还开发了一个软件工具,使用先进的机器学习技术来分析数据并确定内容的真实性。该工具和数据集预计将惠及各类主体,从公共部门机构到出版商和 fact-checking 组织。进一步的数据集探索将促进假新闻检测,potentially stimulate 在其他语言中实现类似模型的实施。该论文聚焦于数据集的创建和组成,因此不包括对软件工具进行详细评估,该评估计划在项目的后续阶段进行。
引用
@article{arxiv.2407.01393,
title = {POLygraph: Polish Fake News Dataset},
author = {Daniel Dzienisiewicz and Filip Graliński and Piotr Jabłoński and Marek Kubis and Paweł Skórzewski and Piotr Wierzchoń},
journal= {arXiv preprint arXiv:2407.01393},
year = {2024}
}
备注
14 pages, 1 figure, accepted to the 14th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA'24)