中文

不可靠新闻检测数据集中的隐藏偏差

计算与语言 2021-04-21 v1 人工智能

摘要

自动不可靠新闻检测是一个具有巨大潜在影响的研究问题。近来,若干论文在大规模新闻数据集上展示了有前景的结果,其模型仅使用文章本身而未借助任何事实核查机制或检索任何支撑证据。本工作中,我们仔细审视这些数据集。尽管它们均为未来研究提供了宝贵资源,我们观察到若干可能导致结果在更真实设定中无法泛化的问题。具体而言,我们表明数据收集过程中的选择偏差导致数据集中出现不期望的人为伪迹。此外,尽管多数系统在单篇文章层面训练与预测,训练与评估数据中重叠的文章来源可提供模型可利用的强混淆因素。在该混淆因素存在下,模型可通过直接记忆站点-标签映射而非建模不可靠新闻检测的真实任务来取得良好性能。我们在无训练/测试来源重叠的干净划分中观察到所有被测模型准确率显著下降(>10%)。利用观察与实验结果,我们就如何为不可靠新闻检测任务创建更可靠的数据集提供实用建议。我们建议未来数据集创建包含一个简单模型作为难度/偏差探针,且未来模型开发使用干净的非重叠站点与日期划分。

关键词

引用

@article{arxiv.2104.10130,
  title  = {Hidden Biases in Unreliable News Detection Datasets},
  author = {Xiang Zhou and Heba Elfardy and Christos Christodoulopoulos and Thomas Butler and Mohit Bansal},
  journal= {arXiv preprint arXiv:2104.10130},
  year   = {2021}
}

备注

EACL 2021 (11 pages, 3 figures, 8 tables)