VEWS:一个维基百科破坏者早期预警系统
社会与信息网络
2015-07-07 v1 物理与社会
摘要
我们研究在任何人或已知破坏检测系统报告标记潜在破坏者之前检测维基百科上的破坏者的问题,以便尽早将这些用户呈现给维基百科管理员。我们利用多种经典机器学习方法,但开发了三组新颖的特征。我们的维基百科破坏者行为(WVB)方法使用一组新颖的用户编辑模式作为特征,将某些用户分类为破坏者。我们的维基百科转移概率矩阵(WTPM)方法使用从转移概率矩阵导出的一组特征,然后通过神经网络自编码器进行降维,将某些用户分类为破坏者。VEWS方法融合了前两种方法。在不使用其他用户提供的任何信息(如回退)的情况下,这些算法各自具有超过85%的分类准确率。此外,当考虑时间近因性时,准确率接近90%。我们在一个新建的数据集上进行了详细实验,该数据集包含约3.3万名维基百科用户(包括编辑者黑名单和白名单)及77万次编辑。我们描述了区分破坏者与非破坏者的具体行为。我们表明,VEWS优于当今已知的最佳破坏检测算法ClueBot NG和STiki。此外,VEWS检测到的破坏者数量远超ClueBot NG,且在两者均检测到破坏者时,平均比ClueBot NG早2.39次编辑检测到。然而,我们表明VEWS与ClueBot NG的组合可以构成一个准确率更高的全自动破坏者早期预警系统。
引用
@article{arxiv.1507.01272,
title = {VEWS: A Wikipedia Vandal Early Warning System},
author = {Srijan Kumar and Francesca Spezzano and V. S. Subrahmanian},
journal= {arXiv preprint arXiv:1507.01272},
year = {2015}
}
备注
To appear in Proceedings of the 21st ACM SIGKDD Conference of Knowledge Discovery and Data Mining (KDD 2015)