中文

审视基于静态数据集训练的计算谣言检测模型的局限性

计算与语言 2024-03-26 v2

摘要

谣言检测模型的一个关键方面是其泛化能力,尤其是检测新兴、先前未知谣言的能力。以往研究表明,基于内容(即仅以源帖子作为输入)的谣言检测模型在未见谣言上往往表现较差。与此同时,基于上下文模型的潜力在很大程度上尚未被挖掘。本文的主要贡献在于深入评估基于内容与基于上下文的模型在检测新的、未见谣言时的性能差距。我们的实证发现表明,基于上下文的模型仍过度依赖从谣言源帖子衍生的信息,并倾向于忽视上下文信息可发挥的重要作用。我们还研究了数据划分策略对分类器性能的影响。基于实验结果,本文就如何在训练谣言检测方法时最小化静态数据集中时间概念漂移的影响提供了实用建议。

关键词

引用

@article{arxiv.2309.11576,
  title  = {Examining the Limitations of Computational Rumor Detection Models Trained on Static Datasets},
  author = {Yida Mu and Xingyi Song and Kalina Bontcheva and Nikolaos Aletras},
  journal= {arXiv preprint arXiv:2309.11576},
  year   = {2024}
}

备注

Accepted at LREC-COLING 2024