从地理定位Twitter指名道姓中提取虚假信息洞察
计算与语言
2021-08-09 v1 机器学习
摘要
本文展示了一种两阶段方法,通过结合地理空间分类与基于嵌入的多语言语言建模,从与虚假信息相关的社交媒体数据中提取洞察。具体而言,分析聚焦于Twitter及三种欧洲语言(英语、法语和西班牙语)的虚假信息。首先,使用BERT将Twitter数据分类为欧洲与非欧洲集合。其次,对分类后的文本应用Word2vec,得到三种目标语言的以欧洲为中心、非以欧洲为中心和全局的数据表示。该比较分析不仅展示了分类方法的有效性,还凸显了虚假信息相关媒体在地理、时间和语言上的差异。因此,本工作的贡献有三方面:(i)一种新颖的与语言无关的基于transformer的地理定位方法;(ii)一种利用词汇特异性和词嵌入探究用户生成内容的分析方法;(iii)一个包含3600万条英语、法语和西班牙语虚假信息相关推文的数据集。
引用
@article{arxiv.2108.03067,
title = {Deriving Disinformation Insights from Geolocalized Twitter Callouts},
author = {David Tuxworth and Dimosthenis Antypas and Luis Espinosa-Anke and Jose Camacho-Collados and Alun Preece and David Rogers},
journal= {arXiv preprint arXiv:2108.03067},
year = {2021}
}
备注
Accepted for presentation at KDD 2021 - Workshop On Deriving Insights From User-Generated Text