小型语言模型用于网络钓鱼网站检测:成本、性能与隐私权衡
密码学与安全
2025-11-20 v1 人工智能
摘要
网络钓鱼网站构成网络安全的主要威胁,利用无意识的用户造成巨大的财务和组织性损失。传统的机器学习方法需要大量特征工程,持续重新训练,并需维持高昂的基础设施维护成本。与此同时,专有的大型语言模型(LLM)在网络钓鱼相关分类任务中展现出强大的性能,但其运营成本高昂且依赖外部提供者,限制了其在许多业务环境中的实际采用。本文探讨了仅凭原始 HTML 代码即可检测网络钓鱼网站的小型语言模型(SLM)的可行性。其关键优势在于可部署于本地基础设施,使组织对数据和运营拥有更大的控制权。我们系统评估了 15 种常见的小型语言模型(SLM),参数规模从 10 亿到 70 亿不等,基准测试其分类准确率、计算需求和成本效益。我们的结果揭示了检测性能与资源消耗之间的权衡,表明尽管 SLM 在性能上不及最先进的专有 LLM,但仍可作为外部 LLM 服务的可行且可扩展的替代方案。通过呈现成本与收益的比较分析,本工作为未来在网络钓鱼检测系统中适应、微调和部署 SLM 的研究奠定了基础,旨在平衡安全效能与经济实用性。
引用
@article{arxiv.2511.15434,
title = {Small Language Models for Phishing Website Detection: Cost, Performance, and Privacy Trade-Offs},
author = {Georg Goldenits and Philip Koenig and Sebastian Raubitzek and Andreas Ekelhart},
journal= {arXiv preprint arXiv:2511.15434},
year = {2025}
}