中文

维基百科破坏者早期检测:从用户行为到用户嵌入

密码学与安全 2017-06-06 v1 计算与语言 计算机与社会

摘要

维基百科是最大的在线百科全书,允许任何人编辑条目。本文提出利用深度学习基于用户的编辑历史检测破坏者。具体地,我们开发了多源长短期记忆网络(M-LSTM)来建模用户行为,使用多种用户编辑方面作为输入,包括编辑回退信息的历史、编辑页面标题与分类。借助M-LSTM,我们可以将每个用户编码为一个低维实值向量,称为用户嵌入(user embedding)。同时,作为一个序列模型,M-LSTM在用户每次提交新编辑后更新用户嵌入。因此,我们可以基于最新用户嵌入动态预测用户是良性还是破坏者。此外,这些用户嵌入对于发现协同破坏者至关重要。

关键词

引用

@article{arxiv.1706.00887,
  title  = {Wikipedia Vandal Early Detection: from User Behavior to User Embedding},
  author = {Shuhan Yuan and Panpan Zheng and Xintao Wu and Yang Xiang},
  journal= {arXiv preprint arXiv:1706.00887},
  year   = {2017}
}

备注

14 pages, 3 figures