基于字符N元文法的Twitter假新闻传播者检测:CLEF 2020 PAN笔记
计算与语言
2020-09-30 v1
摘要
假新闻作者常从已核实新闻源取用事实,并混入误导信息以制造混淆、在读者中引发不安。假新闻传播从而可能对我们的社会产生严重影响。它们可以左右政治选举、压低股价或摧毁企业或公众人物的声誉。若干网站已承担核查谣言与指控的使命,但常不够快以核查所有传播新闻的内容。尤其是社交媒体网站为信息的快速扩散提供了便捷平台。为限制假新闻在社交媒体用户间传播,今年PAN 2020挑战赛的任务聚焦于假新闻传播者。该任务旨在判断能否区分过去分享过假新闻的作者与从未如此的作者。在本笔记中,我们描述用于Twitter假新闻检测任务的画像系统。为此,我们从多语言视角(即英语和西班牙语)进行不同特征提取技术与学习实验。我们最终提交的系统使用字符n元文法作为特征,结合英语的线性SVM与西班牙语的逻辑回归。我们提交的模型在英语和西班牙语官方测试集上分别取得73%和79%的总体准确率。我们的实验表明,难以在Twitter上明确区分固化的假新闻传播者与分享可信信息的用户,留待进一步研究。我们的模型在72个竞争者中排名第3。
引用
@article{arxiv.2009.13859,
title = {Fake News Spreader Detection on Twitter using Character N-Grams. Notebook for PAN at CLEF 2020},
author = {Inna Vogel and Meghana Meghana},
journal= {arXiv preprint arXiv:2009.13859},
year = {2020}
}
备注
CLEF 2020 Labs and Workshops, Notebook Papers