中文

解构API调用序列在恶意软件分析中的特征工程

密码学与安全 2025-12-02 v1

摘要

机器学习(ML)已广泛用于恶意软件分析中的API调用序列,这通常需要专业领域专家从原始数据中提取相关特征。提取的特征在恶意软件分析中起着关键作用。传统特征提取基于人类领域知识,而趋势是使用自然语言处理(NLP)进行自动特征提取。这引出了一个问题:如何有效地基于API调用序列选择恶意软件分析的特征?为此,本文提出了一项全面的研究,探讨特征工程对恶意软件分类的影响。我们首先在卷积神经网络(CNN)、长短期记忆网络(LSTM)和Transformer三个模型下,对知识驱动和NLP驱动的特征工程方法进行比较性能评估。我们观察到,针对所有指标,采用知识驱动特征工程的模型通常优于使用NLP驱动特征工程的模型,特别是在样本量较小的情况下。然后我们分析了来自API调用序列的完整数据特征集,分析结果显示,模型通常关注诸如句柄和虚拟地址等特征,这些特征在不同执行之间变化,难以被人类分析师解释。

关键词

引用

@article{arxiv.2512.01666,
  title  = {Demystifying Feature Engineering in Malware Analysis of API Call Sequences},
  author = {Tianheng Qu and Hongsong Zhu and Limin Sun and Haining Wang and Haiqiang Fei and Zheng He and Zhi Li},
  journal= {arXiv preprint arXiv:2512.01666},
  year   = {2025}
}