中文

面向机器学习的良性与恶意软件包分类

密码学与安全 2025-11-20 v1

摘要

最近,开源软件包仓库中的恶意开源软件包数量急剧增加。虽然主要安全扫描器专注于识别开源软件包中已知的常见漏洞与暴露(CVE),但几乎没有研究针对检测恶意软件包。恶意开源软件包检测通常需要静态分析、动态分析或两者结合。动态分析更为有效,因为它可以暴露软件包在运行时的行为。然而,当前的动态分析工具(例如 ossf 的 package-analysis)缺乏一种自动方法来区分恶意软件包和良性软件包。本文提出了一种从动态分析(例如执行的命令)中提取特征并利用机器学习技术自动对软件包进行良性或恶意分类的 approach。我们评估了 nearly 2000 个 npm 软件包,结果显示机器学习分类器在 AUC 为 0.91,误报率几乎为 0%。

关键词

引用

@article{arxiv.2511.15033,
  title  = {Towards Classifying Benign And Malicious Packages Using Machine Learning},
  author = {Thanh-Cong Nguyen and Ngoc-Thanh Nguyen and Van-Giau Ung and Duc-Ly Vu},
  journal= {arXiv preprint arXiv:2511.15033},
  year   = {2025}
}

备注

5 pages, 2 figures, 3 tables