简单基线在错误信息检测中令人惊讶的性能
计算与语言
2021-04-15 v1 机器学习
摘要
随着社交媒体在我们日常生活中日益突出,检测有价值内容并防止虚假信息与未证实谣言传播变得愈发重要。尽管文献中已提出许多复杂且成功的模型,它们常与较旧的NLP基线(如SVM、CNN和LSTM)比较。在本文中,我们考察了一组广泛的现代基于transformer的语言模型,并表明通过基础微调,这些模型可与近期提出的最先进方法竞争,甚至显著超越后者。我们提出将我们的框架作为创建和评估错误信息检测新方法的基线。我们进一步研究了一组全面的基准数据集,并讨论了潜在的数据泄漏以及仔细设计实验和理解数据集以考虑混杂变量的必要性。作为一个极端案例,我们展示仅基于推文ID的前三位数字(包含日期信息)进行分类,就在假新闻检测的常用基准数据集Twitter16上取得了最先进的性能。我们提供了一个简单工具来检测此问题,并建议了在未来数据集中缓解该问题的步骤。
引用
@article{arxiv.2104.06952,
title = {The Surprising Performance of Simple Baselines for Misinformation Detection},
author = {Kellin Pelrine and Jacob Danovitch and Reihaneh Rabbany},
journal= {arXiv preprint arXiv:2104.06952},
year = {2021}
}