基于RoBERTa增强合成的恶意API请求检测
密码学与安全
2025-05-16 v3
摘要
Web应用程序和API面临来自恶意行为者的持续威胁,他们试图利用漏洞获取非法利益。为了防御这些威胁,必须拥有能够识别各种恶意行为的异常检测系统。然而,该领域的一个重大挑战是训练数据的有限可用性。现有数据集通常不能充分覆盖实际场景中遇到的多样化API结构、参数格式和使用模式。因此,在这些数据集上训练的模型往往难以泛化,可能无法检测到不太常见或新兴的攻击向量。为了提高检测准确性和鲁棒性,获取更大、更具代表性的数据集以捕捉API流量的真实变异性至关重要。为了解决这个问题,我们引入了一个GAN启发的学习框架,通过有针对性的、领域感知的合成来扩展有限的API流量数据集。借鉴自然语言处理(NLP)技术,我们的方法利用基于Transformer的架构,特别是RoBERTa,来增强API请求的上下文表示,并生成与安全特定语义一致的真实合成样本。我们在两个基准数据集CSIC 2010和ATRDF 2023上评估了我们的框架,并与之前的数据增强技术进行了比较,以评估领域特定合成的重要性。此外,我们将增强数据应用于各种异常检测模型,以评估其对分类性能的影响。我们的方法在CSIC 2010上F1分数提高了4.94%,在ATRDF 2023上提高了21.10%。本工作的源代码可在https://github.com/ArielCyber/GAN-API获取。
引用
@article{arxiv.2405.11258,
title = {RoBERTa-Augmented Synthesis for Detecting Malicious API Requests},
author = {Udi Aharon and Revital Marbel and Ran Dubin and Amit Dvir and Chen Hajaj},
journal= {arXiv preprint arXiv:2405.11258},
year = {2025}
}
备注
14 pages, 3 figures, 6 tables