中文

EMBERSim:用于提升恶意软件分析中相似性搜索的大规模数据库

机器学习 2023-10-04 v1

摘要

近年来,恶意软件检测已从基于启发式的方法转向机器学习,后者在当前高度对抗的威胁环境中被证明更具鲁棒性。尽管我们承认机器学习更善于从日益增多的相似文件中挖掘模式,但我们也注意到面向相似性研究的数据极为匮乏。此外,我们观察到少数相关工作的重点在于量化恶意软件的相似性,往往忽视了干净数据。这种片面的量化在检测绕过情境中尤为危险。我们提议从最大的恶意软件分类数据集之一 EMBER 出发,解决二进制文件相似性研究领域的不足。我们用相似性信息以及恶意软件类别标签增强 EMBER,以支持相似性空间的进一步研究。我们的贡献有三方面:(1) 发布 EMBER 的增强版本 EMBERSim,其包含相似性感知标签;(2) 利用开源工具 AVClass 基于 VirusTotal 数据自动确定恶意软件类别标签来丰富 EMBERSim;(3) 描述并分享我们的类别打分技术与叶节点相似性方法的实现。

关键词

引用

@article{arxiv.2310.01835,
  title  = {EMBERSim: A Large-Scale Databank for Boosting Similarity Search in Malware Analysis},
  author = {Dragos Georgian Corlatescu and Alexandru Dinu and Mihaela Gaman and Paul Sumedrea},
  journal= {arXiv preprint arXiv:2310.01835},
  year   = {2023}
}

备注

Accepted at the 37th Conference on Neural Information Processing Systems (NeurIPS 2023) Track on Datasets and Benchmarks