基于内容的半监督 misinformation 检测:通过张量嵌入
机器学习
2018-04-25 v1 社会与信息网络
应用统计
机器学习
摘要
假新闻可能有意被制造以推动经济、政治和社会利益,并会对人类信念与决策产生负面影响。因此,假新闻检测是一个新兴问题,在过去几年变得极为普遍。该主题的大多数现有工作聚焦于手动特征提取和利用大量已标注(假或真)文章的监督分类模型。相反,我们聚焦于基于内容的假新闻文章检测,同时假设我们拥有少量由人工事实核查员或自动化来源提供的标签。我们认为,在海量内容存在且其中大多数无法轻易被事实核查的情况下,这是一种更现实的设定。为此,我们将新闻文章集合表示为多维张量,利用张量分解导出简洁的文章嵌入以捕获每篇新闻文章的空间/上下文信息,并使用这些嵌入构建逐文章的图,在其上传播有限标签。在三个真实世界数据集上的结果表明,我们的方法表现与全监督的现有模型相当或更好,即我们使用更少标签实现了更好的检测准确率。特别地,我们提出的方法在仅使用某公开数据集 30% 标签时达到 75.43% 的准确率,而基于 SVM 的分类器为 67.43%。此外,我们的方法在仅使用 2% 标签的情况下于一个大型数据集中达到 70.92% 的准确率。
引用
@article{arxiv.1804.09088,
title = {Semi-supervised Content-based Detection of Misinformation via Tensor Embeddings},
author = {Gisel Bastidas Guacho and Sara Abdali and Neil Shah and Evangelos E. Papalexakis},
journal= {arXiv preprint arXiv:1804.09088},
year = {2018}
}