中文

探查流行基于事件的谣言检测基准中的伪相关

社会与信息网络 2022-09-20 v1 人工智能 计算与语言

摘要

随着社交媒体成为错误信息传播的热床,谣言检测这一关键任务在开源基准数据集的推动下取得了可喜进展。尽管被广泛使用,我们发现这些数据集存在伪相关,现有研究忽视了这一点并导致对现有谣言检测性能的严重高估。伪相关源于三个原因:(1) 基于事件的数据收集与标注方案将同一底层事件的多个高度相似帖子赋予相同真实性标签;(2) 合并多个数据源将来源身份与真实性标签虚假关联;(3) 标注偏差。在本文中,我们仔细考察了三个最流行的谣言检测基准数据集(即 Twitter15、Twitter16 和 PHEME),并提出事件分离的谣言检测作为消除伪线索的解决方案。在事件分离设定下,我们观察到现有 SOTA 模型的准确率大幅下降超过 40%,仅与一个简单神经分类器相当。为更好地解决该任务,我们提出 Publisher Style Aggregation (PSA),一种可泛化的方法,聚合发布者发帖记录以学习写作风格与真实性立场。大量实验表明,我们的方法在有效性、效率与可泛化性上优于现有基线。

关键词

引用

@article{arxiv.2209.08799,
  title  = {Probing Spurious Correlations in Popular Event-Based Rumor Detection Benchmarks},
  author = {Jiaying Wu and Bryan Hooi},
  journal= {arXiv preprint arXiv:2209.08799},
  year   = {2022}
}

备注

Accepted to ECML-PKDD 2022