LLM-based恶意软件检测与解释:参数调优 vs. 完全微调的比较研究
密码学与安全
2025-11-26 v1 人工智能
摘要
本研究考察了低秩适应(LoRA)微调的大型语言模型(LLM)是否能够近似实现在生成人类可解释决策和解释方面的完全微调模型性能。实现可信的恶意软件检测,特别是在涉及LLM的情况下,仍然是一个重大挑战。我们开发了一个评估框架,使用双语评估下研究(Bilingual Evaluation Understudy, BLEU)、召回导向概述评估(Recall-Oriented Understudy for Gisting Evaluation, ROUGE)以及语义相似性指标对解释质量进行基准测试。实验结果表明,完全微调在综合得分上最高,BLEU和ROUGE提升最高可达10%。然而,中等范围的LoRA模型在两个指标上超过完全微调,同时将模型大小约降低81%,训练时间缩短80%以上(针对15.5%可训练参数的LoRA模型)。这些发现表明,LoRA在解释性和资源效率之间提供了实用的平衡,使其能够在资源受限的环境中部署,而不牺牲解释质量。通过为恶意软件分类提供基于特征的自然语言解释,该方法增强了透明度、分析师信心和恶意软件检测系统的运营可扩展性。
引用
@article{arxiv.2511.19654,
title = {Accuracy and Efficiency Trade-Offs in LLM-Based Malware Detection and Explanation: A Comparative Study of Parameter Tuning vs. Full Fine-Tuning},
author = {Stephen C. Gravereaux and Sheikh Rabiul Islam},
journal= {arXiv preprint arXiv:2511.19654},
year = {2025}
}
备注
Accepted in IEEE Big Data 2025