用于高级拼写错误投机检测的大型语言模型训练
密码学与安全
2025-03-31 v1 人工智能
网络与互联网体系结构
摘要
拼写错误投机是一种长期存在的网络安全威胁,通过利用输入URL时的 human 错误来欺骗用户,传播恶意软件并进行网络釣魚攻击。随着域名的普及以及新顶级域名(TLD)的出现,拼写错误投机技术日益复杂,构成对个人、企业及国家网络安全基础设施的重大风险。传统的检测方法主要关注众所周知的模仿模式,难以识别更复杂的攻击。本研究引入一种新方法,利用大型语言模型(LLM)来增强拼写错误投机检测。通过在字符级转换和基于模式的启发式方法上训练 LLM,而非使用域名特定数据,可以发展出一种更具适应性和韧性的检测机制。实验结果表明,经过精细调优后,Phi-4 14B 模型在其他所测试模型中表现最佳,仅需少量训练样本即可实现 98% 的准确率。这项研究凸显了大型语言模型在网络安全应用中的潜力,特别是针对基于域名的欺骗策略,并提供了关于优化威胁检测机器学习策略的见解。
引用
@article{arxiv.2503.22406,
title = {Training Large Language Models for Advanced Typosquatting Detection},
author = {Jackson Welch},
journal= {arXiv preprint arXiv:2503.22406},
year = {2025}
}
备注
6 pages, 1 figure