EGGS:一种用于社交网络垃圾信息关系建模的灵活方法
社会与信息网络
2020-01-30 v2 信息检索
机器学习
摘要
社交网站面临着源源不断的垃圾信息——这些 unwanted messages 会分散、骚扰甚至欺诈诚实用户的注意力。这类消息往往非常简短,难以孤立识别。此外,垃圾信息传播者会伪装其消息以显得合法,诱使用户点击链接并骗过垃圾过滤器容忍其恶意行为。因此,一些垃圾过滤器会检查领域中的关系结构(例如用户与消息之间的连接)以更好地识别欺骗性内容。然而,即便使用了关系结构,也常以不完整或临时性的方式加以利用。本文提出 Extended Group-based Graphical models for Spam (EGGS,基于组的扩展图模型用于垃圾信息),一种用于在线社交网络中垃圾信息分类的通用方法。我们不再独立地标记每条消息,而是将相关消息(当它们具有相同作者、相同内容或其他领域特定连接时)归为一组。为对相关消息进行推理,我们结合两种流行方法:堆叠图学习(SGL)与概率图模型(PGM)。两种方法都捕捉了“当相关消息也为垃圾信息时,该消息更可能为垃圾”这一思想,但实现方式不同;SGL 使用序列分类器预测,而 PGM 使用概率推断。我们将该方法应用于四个不同的社交网络领域。在大多数实验设置下,EGGS 比独立模型更准确,尤其在正确标签不确定时。对于 PGM 实现,我们将马尔可夫逻辑网络与概率软逻辑进行比较,发现两者表现均良好且互不占优,而 SGL 与 PGM 的组合通常优于单独使用二者。
引用
@article{arxiv.2001.04909,
title = {EGGS: A Flexible Approach to Relational Modeling of Social Network Spam},
author = {Jonathan Brophy and Daniel Lowd},
journal= {arXiv preprint arXiv:2001.04909},
year = {2020}
}
备注
10 pages, 6 figures, 5 tables. STARAI 2020