联邦学习在钓鱼邮件检测中的评估
机器学习
2021-05-24 v3 密码学与安全
摘要
利用人工智能 (AI) 检测钓鱼邮件主要依赖于大规模集中式数据集,这使其面临诸多隐私、信任与法律问题。此外,鉴于商业敏感信息泄露的风险,各组织不愿共享邮件。因此,通常难以获取足够邮件来高效训练全局 AI 模型。相应地,隐私保护的分布式协作机器学习,尤其是联邦学习 (FL),成为一种迫切需求。尽管 FL 已在医疗领域普及,但关于多组织协作背景下基于 FL 的钓鱼检测的有效性与效能仍存疑问。据我们所知,本文工作是首个研究 FL 在邮件反钓鱼中应用的工作。本文基于深度神经网络模型,特别是 RNN 与 BERT 进行钓鱼邮件检测。它分析了在各种设定下(包括平衡与非对称数据分布)FL 纠缠的学习性能。我们的结果证实,在平衡数据集且组织数量较少时,FL 在钓鱼邮件检测中的性能统计量与集中式学习相当。此外,我们观察到当增加组织数量时性能有所变化。对于固定的总邮件数据集,基于全局 RNN 的模型在组织数从 2 增至 10 时准确率下降 1.8%。相反,BERT 准确率在从 2 到 5 个组织时上升 0.6%。然而,若在 FL 框架中引入新组织时允许增加整体邮件数据集,则通过实现更快的收敛速度改善了组织级性能。此外,若邮件数据集分布高度非对称,FL 因其输出高度不稳定而导致整体全局模型性能受损。
引用
@article{arxiv.2007.13300,
title = {Evaluation of Federated Learning in Phishing Email Detection},
author = {Chandra Thapa and Jun Wen Tang and Alsharif Abuadbba and Yansong Gao and Seyit Camtepe and Surya Nepal and Mahathir Almashor and Yifeng Zheng},
journal= {arXiv preprint arXiv:2007.13300},
year = {2021}
}
备注
Submitted for journal publication