基于词汇线索与感知确定性趋势的真实性计算
计算与语言
2017-07-12 v2
摘要
我们提出一种数据驱动的方法,用于确定社交媒体数据上的一组谣言性声明的真实性。来自不同来源且与某谣言相关的推文在三个层面上被处理:首先,基于与我们新闻使用案例相关的四个文本线索类别,为每条推文分配事实性值;这些类别融合了基于极性的说话者支持以及基于确定性和推测的承诺。接下来,这些词汇线索的比例在广义线性回归模型中用作推文确定性的预测变量。随后,词汇线索比例、预测确定性以及它们的时间过程特征被用于计算每条谣言的真实性,具体通过谣言解决推文的身份及其二元解决值判断来表征。该系统在无需访问语言外资源的情况下运行。在可提供手工标注样本的数据部分上进行评估,其在识别谣言解决推文上取得了 .74 的 F1 分数,在预测谣言被解决为真实或虚假上取得了 .76 的 F1 分数。
引用
@article{arxiv.1611.02590,
title = {Veracity Computing from Lexical Cues and Perceived Certainty Trends},
author = {Uwe D. Reichel and Piroska Lendvai},
journal= {arXiv preprint arXiv:1611.02590},
year = {2017}
}
备注
to appear in: Proc. 2nd Workshop on Noisy User-generated Text, Osaka, Japan, 2016