中文

防钓鱼检测中的鲁棒性、成本与攻击面集中度

机器学习 2026-03-20 v1

摘要

基于工程化网站特征构建的防钓鱼检测器在独立同分布(i.i.d.)评估下可达近乎完美的准确率,但部署安全性取决于其对后部署特征操纵的鲁棒性。我们通过构建成本感知的对抗式攻击框架,建模离散、单调特征编辑下的攻击者预算,从而研究了这一差距。本文引入了三个诊断指标:最小化对抗成本(MEC)、对抗生存率 S(B)S(B),以及鲁棒性集中度指数(RCI)。在UCI防钓鱼网站基准数据集上(11,055个实例,30个二元特征),Logistic回归、随机森林、梯度提升树和XGBoost模型在静态评估下均实现 AUC0.979\mathrm{AUC}\ge 0.979。在预算受限的消毒式对抗攻击下,鲁棒性跨模型架构趋于收敛:中位数MEC为2,且超过80%的最小成本成功攻击集中于三个低成本特征表面。特征限制仅在移除所有主导低成本转换后才能提升鲁棒性。在严格成本方案下,倾向基础设施的特征集对集成模型显示17-19%的不可行质量,而可攻击实例的中位数MEC保持不变。我们形式化了这种收敛现象:若正确检测的钓鱼实例中有正比例比例可通过单个最小成本 cminc_{\min} 的特征转换实现攻击,则任何分类器在不修改特征表示或成本模型的情况下,都无法将相应MEC分位数提高到 cminc_{\min} 以上。防钓鱼检测的对抗鲁棒性由特征经济学决定,而非模型复杂度。

关键词

引用

@article{arxiv.2603.19204,
  title  = {Robustness, Cost, and Attack-Surface Concentration in Phishing Detection},
  author = {Julian Allagan and Mohamed Elbakary and Zohreh Safari and Weizheng Gao and Gabrielle Morgan and Essence Morgan and Vladimir Deriglazov},
  journal= {arXiv preprint arXiv:2603.19204},
  year   = {2026}
}

备注

14 pages, 4 figures, 9 tables