中文

Twitter 上无监督用户立场检测

社会与信息网络 2020-05-22 v3

摘要

我们提出一种高效的无监督框架,用于检测多产 Twitter 用户针对争议性话题的立场。具体而言,我们使用降维将用户投影到低维空间,随后进行聚类,从而找到代表不同立场的核心用户。相较于基于有监督或半监督分类的已有方法,我们的框架具有三大优势。首先,我们不需要任何用户先验标注:相反,我们创建聚类,其后的手动标注要容易得多,例如只需数秒或数分钟而非数小时。其次,无论是指定相关立场(标签)还是执行实际标注,都不需要领域或话题层面的知识。第三,我们的框架在面对数据偏斜时具有鲁棒性,例如某些用户或某些立场在数据中代表性更强时。我们在三个不同数据集(英语和土耳其语)上,通过不同的用户相似度特征、数据集规模、降维方法和聚类算法组合实验,以确定最有效且计算最高效的组合。我们还在涵盖六个不同争议话题的额外推文集上进一步验证了结果。我们在效率与效果上最佳的组合使用被转推账户作为特征、UMAP 用于降维、Mean Shift 用于聚类,并产出少量高质量用户聚类,通常仅 2–3 个,纯度超过 98%。所得用户聚类可用于训练下游分类器。此外,我们的框架对超参数值变化及随机初始化均具有鲁棒性。

关键词

引用

@article{arxiv.1904.02000,
  title  = {Unsupervised User Stance Detection on Twitter},
  author = {Kareem Darwish and Peter Stefanov and Michaël Aupetit and Preslav Nakov},
  journal= {arXiv preprint arXiv:1904.02000},
  year   = {2020}
}