语义感知对比微调:通过判别性嵌入提升多模态恶意软件分类
密码学与安全
2025-05-01 v1 人工智能
机器学习
摘要
恶意软件变种的快速演变需要鲁棒的分类方法来提升网络安全。虽然大语言模型(LLM)提供了生成恶意软件描述以辅助家族分类的潜力,但其效用受限于语义嵌入重叠且与二进制行为特征不匹配。我们提出了一种对比微调(CFT)方法,通过基于余弦相似度针对选定硬负样本来细化 LLM 嵌入,从而使 LLM 能够区分紧密相关的恶意软件家族。我们的做法结合高相似性负样本以增强判别性,同时结合中等层次负样本以增加嵌入多样性,优化精度和泛化能力。在 CIC-AndMal-2020 和 BODMAS 数据集上进行评估,我们的精炼嵌入被集成到多模态分类器中,置于基于 Model-Agnostic Meta-Learning(MAML)的 few-shot 框架下进行实验。实验结果显示,我们的方法在 CIC-AndMal-2020 上仅使用 20 个样本即可实现 63.15% 的分类准确率,显著优于基线方法提升 11-21 个百分点,超越先前的负采样策略。消融研究确认相似度基于选择优于随机采样,提升幅度为 10-23%。此外,微调后的 LLM 生成的属性感知描述可推广至未见变种,弥合了文本与二进制特征之间的鸿沟。本工作通过实现细粒度语义区分,推动了恶意软件分类,并为适应网络安全挑战的可扩展框架提供了可能。
引用
@article{arxiv.2504.21028,
title = {Semantic-Aware Contrastive Fine-Tuning: Boosting Multimodal Malware Classification with Discriminative Embeddings},
author = {Ivan Montoya Sanchez and Shaswata Mitra and Aritran Piplai and Sudip Mittal},
journal= {arXiv preprint arXiv:2504.21028},
year = {2025}
}
备注
8 pages, 5 figures, 5 tables