基于加权层次集成的大型语言模型自动恶意软件家族分类
密码学与安全
2026-04-06 v1 人工智能
摘要
恶意软件家族分类是自动恶意软件分析中的一个具有挑战性的任务,尤其是在充满混淆、封装和快速演变威胁的真实场景中。现有的机器学习和深度学习方法通常依赖标记数据集、手工特征、监督训练或动态分析,这限制了其在开放世界情境中的可扩展性和有效性。本文提出一种基于预训练大型语言模型(LLMs)的加权层次集成的零标签恶意软件家族分类框架。该方法不依赖特征级学习或模型重新训练,而是聚合来自多个具有互补推理能力的 LLMs 的决策级预测。通过经验推导的宏平均 F1 分数对模型输出进行加权,并以分层方式组织:首先解决粗粒度恶意行为,然后分配细粒度恶意软件家族。该结构增强了鲁棒性,减少了单个模型的不稳定性,并符合分析师风格的推理方式。
引用
@article{arxiv.2604.02490,
title = {Automated Malware Family Classification using Weighted Hierarchical Ensembles of Large Language Models},
author = {Samita Bai and Hamed Jelodar and Tochukwu Emmanuel Nwankwo and Parisa Hamedi and Mohammad Meymani and Roozbeh Razavi-Far and Ali A. Ghorbani},
journal= {arXiv preprint arXiv:2604.02490},
year = {2026}
}