中文

诊断与缓解基于权限的 Android 恶意软件检测中的域迁移问题

机器学习 2026-05-15 v2

摘要

基于机器学习的 Android 恶意软件检测器常常在实际部署中因域迁移而失败——即在一个数据源上训练的模型对来自另一个数据的应用表现不佳。本文全面研究了权限基检测器在跨域条件下的可解释性和可推广性。使用两个互补数据集(PerMalDroid 和 NATICUSdroid)和五个集成分类器,我们首先建立了 intra-domain 基准,模型在该基准上可实现超过92%的准确率,然后量化了严重的非对称性能下降。尽管在 NATICUSdroid 上训练的模型对 PerMalDroid 的泛化良好(86%准确率),但反向方向则出现严重下降,准确率降至73%。可解释 AI 分析揭示了双峰特征分布,表明特征重要性在不同域之间高度不稳定——关键权限在不同域之间失去或获得影响。不同域的预测特征集根本不匹配,因为模型依赖于不同、数据集特定的权限。最重要的是,消融研究表明,对大多数模型而言,训练于噪声特征集会导致差的泛化,表明域特定的伪影是比缺失特征更大的障碍。为缓解这一问题,我们验证了一种基于常见特征交集的混合训练策略,成功恢复了跨域性能——在 PerMalDroid 上实现88%准确率,在 NATICUSdroid 上保持97%准确率。这些发现凸显了面向可靠跨域恶意软件检测系统的可解释性重要性,并为提高基于权限的 Android 恶意软件检测器在实际部署中的性能提供了实际路径。

关键词

引用

@article{arxiv.2605.09028,
  title  = {Diagnosing and Mitigating Domain Shift in Permission-Based Android Malware Detection},
  author = {Md Rafid Islam},
  journal= {arXiv preprint arXiv:2605.09028},
  year   = {2026}
}