中文

基于家族与类型构建对抗性恶意软件数据集:生成、规避与投毒评估

密码学与安全 2026-05-26 v1 机器学习

摘要

我们提供了一个来自公开 RawMal-TF 真实恶意软件二进制文件集合中派生出的对抗性恶意软件数据集。通过运用一套对抗性恶意软件生成器,我们构建了两个对抗性 PE 文件数据集:44,347 个带家族标签的样本和 33,596 个带类型标签的样本,分别对 EMBER 分类器实现 98.35% 与 92.20% 的规避率。每个对抗二进制文件均附带详细元数据,包括 EMBER 分数与 VirusTotal 分类。我们进一步通过一系列训练实验展示了恶意软件分类管道易受数据投毒攻击。仅占家族标签数据集训练数据 0.5% 的全错标签对抗样本注入后,使重新训练后分类器的规避率从 26.1% 提升至 92.8%。该数据集已公开发布,以促进针对对抗性恶意软件、投毒攻击以及基于机器学习的恶意软件检测系统鲁棒性的后续研究。

关键词

引用

@article{arxiv.2605.25937,
  title  = {Building an Adversarial Malware Dataset by Family and Type: Generation, Evasion, and Poisoning Evaluation},
  author = {David Košťál and Martin Jureček},
  journal= {arXiv preprint arXiv:2605.25937},
  year   = {2026}
}