LLM-FS:面向高效可解释恶意软件检测的零样本特征选择
机器学习
2026-02-11 v1 密码学与安全
摘要
特征选择(FS)对于构建准确且可解释的检测模型至关,尤其是在高维恶意软件数据集中。传统FS方法(如Extra Trees、方差阈值、基于树的方法、卡方检验、ANOVA、随机选择和顺序注意力)主要依赖统计启发式或模型驱动的重要性评分,往往忽视特征的语义上下文。鼓舞于近期LLM驱动的FS进展,我们探讨了大型语言模型(LLM)是否可在仅使用特征名称和任务描述的零样本设置下指导特征选择,作为传统方法的可行替代方案。我们在EMBOD数据集(EMBER与BODMAS基准数据集的融合)上评估了多个LLM(GPT-5.0、GPT-4.0、Gemini-2.5等),并将其与 established FS方法进行比较,适用于Random Forest、Extra Trees、MLP和KNN等多个分类器。通过准确率、精确率、召回率、F1、AUC、MCC和运行时间等指标评估。我们的结果表明,LLM引导的零样本特征选择在与传统FS方法相当的性能,同时提供了在可解释性、稳定性和减少对标记数据依赖方面的额外优势。这些发现将零样本LLM-based FS定位为有效且可解释的恶意软件检测的有前景的替代策略,为安全关键应用中的知识引导式特征选择之路。
引用
@article{arxiv.2602.09634,
title = {LLM-FS: Zero-Shot Feature Selection for Effective and Interpretable Malware Detection},
author = {Naveen Gill and Ajvad Haneef K and Madhu Kumar S D},
journal= {arXiv preprint arXiv:2602.09634},
year = {2026}
}