中文

ROBAD:鲁棒性对抗感知的局部-全局注意力恶意行为检测顺序模型

机器学习 2025-07-22 v1 社会与信息网络

摘要

检测恶意行为对于确保互联网平台的安全与完整性至关重要。已develop出Several深度学习模型来识别此类用户。这些模型不仅要准确检测恶意行为,还要对旨在规避检测的对抗攻击保持鲁棒性。然而,过去的深度学习检测模型无法满足鲁棒性要求,因为它们对输入序列的微小变化极其敏感。为此,我们聚焦于(1)提高模型的理解能力和(2)增强模型的知识,以便在作出预测时识别潜在的输入修改。为实现这些目标,我们创建了一个新的基于Transformer的分类模型,称为ROBAD(RObust adversary-aware local-global attended Bad Actor Detection model),其使用用户帖子序列生成用户嵌入以检测恶意行为。具体而言,ROBAD首先利用Transformer编码器块双向编码每个帖子,从而构建帖子嵌入以捕获帖子级别的局部信息。随后,它采用Transformer解码器块通过注意力机制建模帖子嵌入中的序列模式,从而生成序列嵌入以获取序列级别的全局信息。最后,为丰富模型的知识,输入经模仿攻击者修改的序列嵌入被输入到对比学习增强的分类层中进行序列预测。本质上,通过捕获局部和全局信息(即帖子和序列信息),并利用恶意行为者在训练中的模拟行为,ROBAD能够对对抗攻击保持鲁棒性。在Yelp和Wikipedia数据集上的广泛实验表明,ROBAD在处于最先进对抗攻击状态下时能够有效检测恶意行为。

关键词

引用

@article{arxiv.2507.15067,
  title  = {ROBAD: Robust Adversary-aware Local-Global Attended Bad Actor Detection Sequential Model},
  author = {Bing He and Mustaque Ahamad and Srijan Kumar},
  journal= {arXiv preprint arXiv:2507.15067},
  year   = {2025}
}

备注

15 pages, 12 tables