虚假与可信新闻特征的机器学习分析
计算与语言
2019-10-08 v1
摘要
假新闻是一种普遍存在的宣传形式,利用社交媒体广泛的覆盖面在网上传播错误信息以操纵公众认知。过去三年中,因其对2016年美国总统选举的影响,假新闻成为媒体的焦点讨论话题。假新闻可带来严重的现实后果:2016年,一名男子因读到希拉里·克林顿将儿童作为性奴藏匿的传言,持步枪走进一家披萨店。本项目提出一种高准确率(87%)的机器学习分类器,基于文章前几句中的词分布及特定语言与风格差异来判断新闻的真实性。这可帮助读者通过寻找开篇中的特定特征来辨识文章真实性,从而做出明智判断。利用来自30个不同网站的2107篇文章的数据集,本项目通过考察模型、数据集与特征,建立了对假新闻与可信新闻间差异的理解。该分类器似乎利用了词分布、语气真实度水平以及副词、形容词和名词频率上的差异。这些文章特征的差异可用于改进未来的分类器。该分类器还可进一步直接作为Google Chrome扩展程序或作为社交媒体平台与新闻网站的过滤器应用,以减少错误信息的传播。
引用
@article{arxiv.1910.02223,
title = {A Machine Learning Analysis of the Features in Deceptive and Credible News},
author = {Qi Jia Sun},
journal= {arXiv preprint arXiv:1910.02223},
year = {2019}
}