中文

基于 API 调用分析的可解释机器学习在勒索软件家族检测与分类中的应用

密码学与安全 2022-11-15 v3 机器学习

摘要

勒索软件近来已成为主要全球威胁之一。勒索软件攻击令人担忧的增长率及新变种促使研究人员不断审视勒索软件的区别性特征并改进其检测策略。应用程序编程接口(API)是一个程序与另一个程序协作的方式;API 调用是它们通信的媒介。勒索软件利用该策略与操作系统交互,并以不同序列发出显著更多数量的调用以请求执行操作。本研究工作利用不同 API 调用的频率来检测并分类勒索软件家族。首先,开发了一个网络爬虫以自动收集 15 个不同勒索软件家族的 Windows 可移植可执行(PE)文件。通过提取 68 个 API 调用的不同频率,我们在两阶段特征工程过程的第一阶段构建了数据集。在特征工程过程的第二阶段选出最显著特征后,我们部署了六种监督机器学习模型:朴素贝叶斯、逻辑回归、随机森林、随机梯度下降、K 近邻和支持向量机。随后,比较所有分类器的性能以选出最佳模型。结果显示逻辑回归可高效将勒索软件分类至对应家族,取得 99.15% 的总体准确率。最后,我们不依赖机器学习模型的“黑箱”特性,而是使用“SHapley Additive exPlanations”(SHAP)值对我们性能最佳的模型进行事后分析,以确证模型预测的透明性与可信度。

关键词

引用

@article{arxiv.2210.11235,
  title  = {Application of Explainable Machine Learning in Detecting and Classifying Ransomware Families Based on API Call Analysis},
  author = {Rawshan Ara Mowri and Madhuri Siddula and Kaushik Roy},
  journal= {arXiv preprint arXiv:2210.11235},
  year   = {2022}
}