中文

AntiPhishStack:基于 LSTM 的堆叠泛化模型用于优化钓鱼网址检测

密码学与安全 2024-01-23 v2 机器学习

摘要

对革命性在线网络服务日益增长的依赖带来了更高的安全风险,尽管采取了广泛的安全措施,钓鱼攻击仍构成持续挑战。依赖机器学习和手工特征的传统钓鱼检测系统难以应对不断演变的策略。深度学习的最新进展为应对新型钓鱼挑战和恶意网址提供了有前景的途径。本文介绍了一个名为 AntiPhishStack 的两阶段堆叠泛化模型,旨在检测钓鱼网站。该模型对称地利用网址和字符级 TF-IDF 特征的学习,增强了其对抗新兴钓鱼威胁的能力。在第一阶段,特征在基础机器学习分类器上进行训练,采用 K 折交叉验证以获得稳健的平均预测。第二阶段采用一个两层堆叠式 LSTM 网络,配备五种自适应优化器进行动态编译,确保对这些特征进行最优预测。此外,来自两个阶段的对称预测结果被优化并整合,以训练一个元 XGBoost 分类器,从而得出最终的稳健预测。这项工作的意义在于,AntiPhishStack 无需事先了解钓鱼特定特征即可推进钓鱼检测。在两个包含良性和钓鱼或恶意网址的基准数据集上进行的实验验证证明了该模型的卓越性能,与现有研究相比,达到了 96.04% 的显著准确率。这项研究为信息安全领域关于对称性与非对称性的持续讨论增添了价值,并为在不断演变的网络威胁面前增强网络安全提供了一种前瞻性的解决方案。

关键词

引用

@article{arxiv.2401.08947,
  title  = {AntiPhishStack: LSTM-based Stacked Generalization Model for Optimized Phishing URL Detection},
  author = {Saba Aslam and Hafsa Aslam and Arslan Manzoor and Chen Hui and Abdur Rasool},
  journal= {arXiv preprint arXiv:2401.08947},
  year   = {2024}
}