ReSCo-CC: 虚假信息关键句子的无监督识别
计算与语言
2020-10-22 v1 人工智能
机器学习
摘要
虚假信息常以长篇文本文章的形式呈现,尤其在与健康相关的领域,常可见于 COVID-19 相关情形。这类文章通常夹杂若干可信句子,而核心虚假信息句子散布其间。本文提出一项新颖的无监督任务:在已知不可信的文档中识别包含关键虚假信息的句子。我们为该任务设计了一种三阶段统计 NLP 方案,首先在具体任务定制特征空间中嵌入句子;随后利用这些特征表示的句子进行聚类;再通过邻近度评分识别关键句子。我们还整理了一个带有句子级虚假信息评分的新数据集以辅助该任务的评估;该数据集已公开以促进进一步研究。基于与声明检测和摘要等相关任务技术以及我们所提方法的简化变体进行的综合实证评估,我们表明本方法能够有效识别核心虚假信息。
引用
@article{arxiv.2010.10836,
title = {ReSCo-CC: Unsupervised Identification of Key Disinformation Sentences},
author = {Soumya Suvra Ghosal and Deepak P and Anna Jurek-Loughrey},
journal= {arXiv preprint arXiv:2010.10836},
year = {2020}
}
备注
The 22nd International Conference on Information Integration and Web-based Applications & Services (iiWAS '20), Chiang Mai, Thailand