面向内部威胁检测的用户基序数建模与 Transformer 编码器
机器学习
2025-07-11 v2
摘要
内部威胁检测由于恶意行为者的授权身份以及异常行为的隐蔽性,面临着独特的挑战。现有的机器学习方法常将用户活动视为孤立事件,无法利用用户行为中的时序依赖性。本研究提出了一种用户基序数建模(UBS)方法,将 CERT 内部威胁数据集转换为适合深度序数建模的结构化时序序列。我们部署 Transformer 编码器架构来建模良性用户活动,并将其重构误差用作异常得分。这些得分随后使用三个无监督异常检测算法进行评估:One-Class SVM(OCSVM)、局部离群因子(LOF)和孤立森林(iForest)。在四个严格设计的测试集上,包括多个 CERT 数据集版本的组合,我们的 UBS-Transformer 流水线始终实现了最先进的性能——显著达到 96.61% 的准确率、99.43% 的召回率、96.38% 的 F1 分数、95.00% 的 AUROC,并且异常阴性(0.0057)和异常阳性(0.0571)率异常低。比较分析表明,我们的方法在表格和传统自编码器基线上显著优于,凸显了序数用户建模和先进异常检测在内部威胁领域的有效性。
引用
@article{arxiv.2506.23446,
title = {User-Based Sequential Modeling with Transformer Encoders for Insider Threat Detection},
author = {Mohamed Elbasheer and Adewale Akinfaderin},
journal= {arXiv preprint arXiv:2506.23446},
year = {2025}
}