中文

PhilaeX:解释 AI 模型在恶意软件检测中的失败与成功

密码学与安全 2022-11-21 v1 人工智能 机器学习

摘要

对 AI 模型预测的解释用于支撑网络安全中的决策,具有关键重要性。当模型错误预测可能导致严重损害甚至生命与关键资产损失时尤为如此。然而,尽管大多数现有 AI 模型在大多数场景中性能强劲,却缺乏对其预测结果提供解释的能力。在本工作中,我们提出一种新颖的可解释 AI 方法,称为 PhilaeX,其提供启发式手段以识别优化特征子集,从而形成对 AI 模型预测的完整解释。它识别导致模型边界预测的特征,并提取具有正向个体贡献的那些特征。随后通过 Ridge 回归模型的优化来量化特征归因。我们通过两个实验验证解释保真度。首先,我们利用 PhilaeX 的特征归因值,评估本方法在正确识别 Android 恶意软件对抗样本中被激活特征的能力。其次,采用删减与增强测试来评估解释的保真度。结果表明,与 LIME 和 SHAP 等最先进方法相比,PhilaeX 能够正确地解释不同类型分类器,且解释保真度更高。

关键词

引用

@article{arxiv.2207.00740,
  title  = {PhilaeX: Explaining the Failure and Success of AI Models in Malware Detection},
  author = {Zhi Lu and Vrizlynn L. L. Thing},
  journal= {arXiv preprint arXiv:2207.00740},
  year   = {2022}
}