丹麦语立场分类与谣言判定
计算与语言
2019-07-03 v1 社会与信息网络
摘要
互联网上充斥着通过微博和社交媒体传播的泛滥谣言。近期研究表明,分析大众对谣言的立场是其真实性的良好指标。一种最先进的系统使用LSTM神经网络,通过考虑整个分支的上下文来自动分类Twitter上帖子的立场;而另一种更简单的决策树分类器,通过细致的特徵工程,表现至少同样好。预测谣言真实性的一种方法是使用立场作为隐马尔可夫模型(HMM)的唯一特徵。本论文生成了一个带立场标注的丹麦语Reddit数据集,并实现了多种用于立场分类的模型。其中,线性支持向量机取得了最佳结果,准确率为0.76,宏F1得分为0.42。此外,实验表明,利用HMM可跨语言和跨平台使用立场标签来预测谣言真实性,准确率达0.82,F1得分为0.67。仅依赖丹麦语数据集可取得更高分数,此时真实性预测的准确率为0.83,F1为0.68。最后,当HMM使用自动生成的立场标签时,仅观察到性能的小幅下降,表明所实现的系统具有实际应用价值。
引用
@article{arxiv.1907.01304,
title = {Danish Stance Classification and Rumour Resolution},
author = {Anders Edelbo Lillie and Emil Refsgaard Middelboe},
journal= {arXiv preprint arXiv:1907.01304},
year = {2019}
}
备注
97(92) pages, 22 figures, 39 tables