中文

转化假新闻:基于 Transformer 的鲁棒可泛化新闻分类

计算与语言 2021-12-06 v2

摘要

随着网络新闻日益普及、假新闻愈发泛滥,核查网络新闻内容真实性的能力变得比以往任何时候都更为重要。该任务属于二分类挑战,而 Transformer 已在其中取得最先进的(state-of-the-art, SOTA)结果。本研究利用公开可用的 ISOT 与 Combined Corpus 数据集,探究 Transformer 识别假新闻的能力,特别关注其对风格、主题和类别分布各异的未知数据集的泛化能力。此外,我们提出一种观点,即基于观点的新闻文章因其主观性与常有的煽动性语言而无法被归类为真或假,并据此提出一种新颖的两步分类流程,将此类文章从模型训练及最终部署的推理系统中剔除。在 ISOT 与 Combined Corpus 数据集上的实验表明,相较于基线方法,Transformer 的分布外泛化 F1 分数最高提升 4.9%,而在采用我们的两步分类流程后进一步提升 10.1%。据我们所知,本研究是首个在此背景下探究 Transformer 泛化能力的工作。

关键词

引用

@article{arxiv.2109.09796,
  title  = {Transforming Fake News: Robust Generalisable News Classification Using Transformers},
  author = {Ciara Blackledge and Amir Atapour-Abarghouei},
  journal= {arXiv preprint arXiv:2109.09796},
  year   = {2021}
}

备注

2021 IEEE International Conference on Big Data (IEEE BigData 2021)