中文

Hoaxpedia:一个统一的维基百科恶作剧文章数据集

计算与语言 2024-09-02 v3 人工智能 机器学习

摘要

恶作剧是一种公认的蓄意制造的虚假信息形式,可能对维基百科等参考知识资源的可信度产生严重影响。检测维基百科恶作剧的难点在于,它们通常按照官方风格指南撰写。在这项工作中,我们首先系统分析了合法维基百科文章与恶作剧文章之间的相似性和差异,并引入了Hoaxpedia,这是一个包含311篇恶作剧文章(来自现有文献和维基百科官方列表)以及语义相似的合法文章的集合,共同构成一个二元文本分类数据集,旨在促进自动化恶作剧检测的研究。在本文中,我们报告了分析多种语言模型、恶作剧与合法文章比例以及文本分类器所接触的文本量(全文与仅文章定义部分)后的结果。我们的结果表明,仅基于内容检测维基百科中的欺骗性内容是困难的但可行的,并通过对编辑历史分布差异的研究补充了我们的分析,发现利用这一特征比利用上下文能获得更好的分类结果。

关键词

引用

@article{arxiv.2405.02175,
  title  = {Hoaxpedia: A Unified Wikipedia Hoax Articles Dataset},
  author = {Hsuvas Borkakoty and Luis Espinosa-Anke},
  journal= {arXiv preprint arXiv:2405.02175},
  year   = {2024}
}