中文

基于领域的潜在个人分析及其在社交媒体冒充检测中的应用

计算与语言 2022-02-24 v3

摘要

齐夫定律定义了给定语料库中词语的排名与其出现频率之间的反比关系,大致将词汇划分为高频词与低频词。在此,我们假定在一个领域内,作者的签名可粗略地由其缺失的流行词与频繁使用的非流行词推导而来。我们设计了一种称为潜在个人分析(LPA)的方法,用于发现领域中实体的基于领域的属性:它们与领域的距离及其签名,后者决定了它们与领域最显著的差异。我们在若干距离度量中确定了最适用于该方法的度量,并构建了作为领域实体的作者们的距离与个人签名。签名由过度使用的术语(相较于平均值)与缺失的流行术语共同构成。我们验证了签名在识别用户方面的正确性与效力,并给出了存在性条件。随后我们展示了该方法在可解释作者归属中的用途:我们定义了利用 LPA 识别社交媒体中两类冒充行为的算法:(1) 拥有多个(sockpuppets)账号的作者;(2) 由多名作者操作的傀儡用户账号。我们验证了这些算法,并将其应用于一个来自社交媒体站点、包含超过 4000 名用户的大规模数据集。我们利用时间速率分析 corroborate 了这些结果。LPA 还可进一步用于在一类组成元素具有长尾分布的科学领域中推导个人属性。

关键词

引用

@article{arxiv.2004.02346,
  title  = {Domain-based Latent Personal Analysis and its use for impersonation detection in social media},
  author = {Osnat Mokryn and Hagit Ben-Shoshan},
  journal= {arXiv preprint arXiv:2004.02346},
  year   = {2022}
}