中文

全在嵌入之中!利用文档嵌入检测假新闻

计算与语言 2023-04-18 v1 人工智能

摘要

随着大众媒体格局从新闻严谨性向社交媒体转变,个性化社交媒体正成为新规范。尽管媒体的数字化进程带来诸多优势,但也增加了通过假新闻传播虚假信息、错误信息和畸形信息的风险。这一有害现象的出现已使社会两极分化,并在特定话题(如选举、疫苗接种等)上操纵公众舆论。此类在社交媒体上传播的信息缺乏传统新闻的严谨性,可能扭曲公众认知并引发社会动荡。自然语言处理与机器学习技术对于开发能够检测假新闻的高效工具至关重要。利用文本数据上下文的模型对于解决假新闻检测问题必不可少,因为它们能在词的向量表示中编码语言特征。本文提出一种新方法,使用文档嵌入构建多个模型,将新闻文章准确标注为可靠或虚假。我们还基于使用二分类或多标签分类检测假新闻的不同架构给出了基准测试。我们在五个大型新闻语料库上使用准确率、精确率和召回率对模型进行了评估。我们取得了比更复杂的 state-of-the-art (SOTA) 深度神经网络模型更好的结果。我们观察到,获得高准确率的最重要因素是文档编码,而非分类模型的复杂度。

关键词

引用

@article{arxiv.2304.07781,
  title  = {It's All in the Embedding! Fake News Detection Using Document Embeddings},
  author = {Ciprian-Octavian Truică and Elena-Simona Apostol},
  journal= {arXiv preprint arXiv:2304.07781},
  year   = {2023}
}