物以类聚:基于语言模型差异的讽刺新闻检测
计算与语言
2020-07-07 v1
摘要
讽刺新闻因其巧妙嵌入的幽默而具有娱乐性,在现代社交媒体中被频繁分享。然而,由于其欺骗性特征,它有时会被误认为事实新闻,从而可能对社会造成危害。我们发现,在讽刺新闻中,语境的词汇与语用属性是取悦读者的关键因素。在本工作中,我们提出一种区分讽刺新闻与真实新闻的方法。该方法利用讽刺写作证据,通过给定一篇新新闻文章时,一个在真实新闻上训练的语言模型与一个在讽刺新闻上训练的语言模型之间的预测损失差异来发挥作用。我们计算语言模型预测损失的若干统计度量作为特征,并将其用于下游分类。所提方法在计算上高效,因为语言模型捕捉了讽刺新闻文档与传统新闻文档之间的语言使用差异,且在应用于其领域之外的文档时具有敏感性。
引用
@article{arxiv.2007.02164,
title = {Birds of a Feather Flock Together: Satirical News Detection via Language Model Differentiation},
author = {Yigeng Zhang and Fan Yang and Yifan Zhang and Eduard Dragut and Arjun Mukherjee},
journal= {arXiv preprint arXiv:2007.02164},
year = {2020}
}
备注
10 pages