基于联邦学习的隐私保护网络威胁检测
密码学与安全
2024-04-09 v1
摘要
尽管基于机器学习的安全检测模型(如恶意软件分类器)取得了良好的性能并得到广泛应用,但它们容易受到概念漂移和攻击者规避性演化的影响,这使得获取最新的威胁数据成为必需。然而,由于各种隐私保护法规(如 GDPR)的实施,安全供应商收集与个人相关且涉及隐私的敏感威胁数据集(如移动设备中的 SMS 垃圾/非垃圾短信)变得越来越具有挑战性,甚至变得不可行。为了解决这些障碍,本研究从有效性、拜占庭鲁棒性和效率三个方面,系统地评估了联邦学习在隐私保护网络威胁检测中的可行性。这得益于多个威胁数据集和威胁检测模型的构建,更重要的是,现实且特定于安全实验的设计。我们在两个代表性的威胁检测任务上评估了联邦学习(Federated Learning, FL),即 SMS 垃圾检测和 Android 恶意软件检测。结果表明,FL 训练的检测模型可以达到与集中式训练的对应模型相当的性能。此外,大多数非独立同分布(non-IID)数据分布对模型性能的影响很小或可忽略不计,而高度基于标签的 non-IID 分布会导致 FL 训练中出现不可忽略的波动和延迟。然后,在现实的威胁模型下,FL 表现出对数据投毒和模型投毒攻击的抗对抗性。特别是,一种实际的数据投毒攻击对模型精度造成的损失不超过 0.14%。在 FL 效率方面,引导策略被证明能有效缓解在基于标签的 non-IID 场景中观察到的训练延迟。
引用
@article{arxiv.2404.05130,
title = {Enabling Privacy-Preserving Cyber Threat Detection with Federated Learning},
author = {Yu Bi and Yekai Li and Xuan Feng and Xianghang Mi},
journal= {arXiv preprint arXiv:2404.05130},
year = {2024}
}