中文

面向百万未知恶意软件变体的新型主动学习方法

密码学与安全 2025-07-08 v1 人工智能 机器学习

摘要

主动学习用于分类通过寻找当前模型最不确定的未标记样本并将其发送给标注者/专家进行标注,以减少标注成本。贝叶斯理论可通过对模型参数施加先验分布并估计这些参数的后验分布来为深度神经网络模型提供概率视角。本文提出了两种新颖的主动学习方法,用于标记属于不同未知现代恶意软件家族的百万恶意软件样本。第一种模型是 Inception-V4+PCA 结合多种支持向量机(SVM)算法(UTSVM、PSVM、SVM-GSU、TBSVM)。第二种模型是基于视觉Transformer 的贝叶斯神经网络 ViT-BNN。我们提出的 ViT-BNN 是一种与当前方法不同的 SOTA 主动学习方法,可适用于特定任务。实验表明,ViT-BNN 在处理不确定性方面更稳定和稳健。

关键词

引用

@article{arxiv.2507.02959,
  title  = {A Novel Active Learning Approach to Label One Million Unknown Malware Variants},
  author = {Ahmed Bensaoud and Jugal Kalita},
  journal= {arXiv preprint arXiv:2507.02959},
  year   = {2025}
}