透过静态分析:通过可解释性揭开恶意软件可视化的神秘面纱
密码学与安全
2025-03-05 v1
摘要
安全研究人员正面临恶意文件的激增,需要快速识别和分类恶意软件家族以实现有效防护。视觉分类器,尤其是卷积神经网络(CNN),已成为完成此任务的重要工具。然而,在医学和自动驾驶等其他高风险领域中常见的鲁棒性和可解释性问题,在当前文献中仍未得到充分研究。尽管研究中提出的深度学习可视化分类器无需专家特征提取即可获得出色的结果,但尚未在可复现性方面得到适当研究。此外,文献尚不清楚这些类型的分类器是如何得出其答案的。我们的研究通过复现六个 CNN 模型并探究其缺陷来填补这些空白。我们采用类激活映射(CAM),如 GradCAM 和 HiResCAM,来评估模型的可解释性。我们在两个标准数据集 MalImg 和 Big2015 以及一个新创建的数据集 VX-Zoo 上评估了 CNN 的性能和可解释性。我们采用这些不同的 CAM 技术来衡量每个模型的可解释性。借助这些工具,我们调查了导致不同模型对输入产生不同解释的潜在因素,使人类研究人员能够识别对区分不同恶意软件家族至关重要的模式,并解释 CNN 模型得出其结论的原因。除了强调可解释性研究中发现的模式外,我们还利用提取的热力图来增强 Visual Transformers 分类器的性能和解释质量。与基准值相比,该方法在各个数据集上的 F1 分数获得了 2% 到 8% 的显著提升。
引用
@article{arxiv.2503.02441,
title = {Through the Static: Demystifying Malware Visualization via Explainability},
author = {Matteo Brosolo and Vinod Puthuvath and Mauro Conti},
journal= {arXiv preprint arXiv:2503.02441},
year = {2025}
}