中文

匿名性挖掘:识别Twitter上的敏感账户

社会与信息网络 2017-02-02 v1 密码学与安全

摘要

我们探索自动发现Twitter上发布敏感内容账户的可行性。解决该问题的一个自然方法是首先创建敏感关键词列表,然后识别在推文中使用这些词的Twitter账户。但这种方法可能忽略未被主观选择的关键词覆盖的敏感账户。在本文中,我们转而通过检查账户拥有的匿名与可识别关注者的比例来探索寻找敏感账户。该方法的动机来自早期研究,其表明敏感账户通常具有大比例的匿名关注者和小比例的可识别关注者。为此,我们首先考虑了自动判定Twitter账户是匿名还是可识别的问题。我们发现简单技术(如检查名单成员资格)表现不佳。我们设计了一个机器学习分类器,将账户分类为匿名或可识别。然后我们基于账户拥有的匿名与可识别关注者的比例将账户分类为敏感。我们将我们的方法应用于约100,000个账户,其拥有4.04亿活跃关注者。该方法发现了因多种原因而敏感的账户。这些账户跨越不同主题,包括那些通常不被视为敏感的或那些与社会污名化话题相关的。为验证我们的方法,我们对检测到的敏感与非敏感账户的推文应用了潜在狄利克雷分配(LDA)主题分析。LDA显示从该方法获得的敏感与非敏感账户在推文中讨论明显不同的话题。我们的结果表明,在Twitter的规模上客观识别敏感账户确实是可能的。

关键词

引用

@article{arxiv.1702.00164,
  title  = {Mining Anonymity: Identifying Sensitive Accounts on Twitter},
  author = {Sai Teja Peddinti and Keith W. Ross and Justin Cappos},
  journal= {arXiv preprint arXiv:1702.00164},
  year   = {2017}
}

备注

A shorter 4-page version of this work has been published as a poster in the International AAAI Conference on Web and Social Media (ICWSM), 2016