中文

面向多语言文件的检测

密码学与安全 2022-04-14 v4 机器学习

摘要

标准化文件格式在计算机软件的开发与使用中发挥关键作用。然而,通过创建在多种文件格式下均有效的文件来滥用标准化文件格式是可能的。由此产生的多语言(polyglot)文件会混淆文件格式识别,使文件的某些部分逃避分析。这对于依赖文件格式识别进行特征提取的恶意软件检测系统尤为成问题。由于某些文件格式规范具有灵活性,依赖文件签名的文件格式识别过程可轻易被规避。尽管已有研究采用比文件签名更全面的方法来识别文件格式,但多语言文件的准确识别仍是一个开放问题。由于恶意软件检测系统常规执行特定于文件格式的特征提取,多语言文件需要在被这些系统摄取前被过滤掉。否则,恶意内容可能未被检测而通过。为解决多语言检测问题,我们使用 mitra 工具组装了一个数据集。随后,我们评估了最常用的文件识别工具 file 的性能。最后,我们展示了一系列机器与深度学习模型的准确率、精确率、召回率和 F1 分数。Malconv2 和 Catboost 在我们的数据集上取得了最高召回率,分别为 95.16% 和 95.45%。这些模型可被整合进恶意软件检测器的文件处理流水线中,以在进行依赖文件格式的特征提取前过滤掉潜在恶意的 polyglot 文件。

关键词

引用

@article{arxiv.2203.07561,
  title  = {Toward the Detection of Polyglot Files},
  author = {Luke Koch and Sean Oesch and Mary Adkisson and Sam Erwin and Brian Weber and Amul Chaulagain},
  journal= {arXiv preprint arXiv:2203.07561},
  year   = {2022}
}