中文

训练-测试数据泄露对基于机器学习的Android恶意软件检测的影响

密码学与安全 2025-07-31 v2

摘要

当机器学习用于Android恶意软件检测时,需要将应用程序转换为数值格式以进行训练和测试。我们发现,不同的Android应用程序普遍存在具有相同或几乎相同应用程序表示的情况。特别是,在测试数据集中的应用程序样本中,可能有很大比例的应用程序与训练数据集中的某个应用程序具有相同或几乎相同的表示。这将导致数据泄露问题,从而夸大机器学习模型在测试数据集上测量的性能。数据泄露不仅可能导致对机器学习模型泛化能力的过于乐观的看法,在某些情况下还可能导致从研究中得出性质不同的结论。我们通过两个案例研究来说明这种影响。在第一个案例研究中,数据泄露夸大了性能结果,但并未在性质上影响研究人员得出的总体结论。在第二个案例研究中,数据泄露问题本会导致从研究中得出性质不同的结论。我们通过剖析机器学习模型的记忆能力和泛化能力,进一步研究了数据泄露的现实世界影响,并表明通过从测试数据中移除泄露,评估结果能更好地反映机器学习模型在现实世界Android恶意软件检测场景中的效用。

关键词

引用

@article{arxiv.2410.19364,
  title  = {The Impact of Train-Test Leakage on Machine Learning-based Android Malware Detection},
  author = {Guojun Liu and Doina Caragea and Xinming Ou and Sankardas Roy},
  journal= {arXiv preprint arXiv:2410.19364},
  year   = {2025}
}