URLTran:利用Transformer改进钓鱼URL检测
密码学与安全
2021-08-30 v3
摘要
浏览器通常包含用于检测钓鱼网页的安全功能。过去,一些浏览器通过评估未知URL是否包含在已知钓鱼页面列表中来判定。然而,随着URL和已知钓鱼页面的数量持续快速增加,浏览器开始将一个或多个机器学习分类器作为其安全服务的一部分,旨在更好地保护终端用户免受危害。虽然可使用额外信息,浏览器通常利用某种分类器评估每个未知URL,以便快速检测这些钓鱼页面。早期的钓鱼检测使用标准机器学习分类器,但近期研究转而提出使用深度学习模型完成钓鱼URL检测任务。与此同时,使用transformer的文本嵌入研究已在许多自然语言处理任务中取得最先进结果。在这项工作中,我们对transformer模型在钓鱼URL检测任务上进行了全面分析。我们考虑了标准掩码语言模型及额外的领域特定预训练任务,并将这些模型与微调的BERT和RoBERTa模型进行比较。结合这些实验的见解,我们提出URLTran,其使用transformer在广泛的极低假阳性率(FPR)范围内显著改进钓鱼URL检测性能,优于其他基于深度学习的方法。例如,在FPR为0.01%时,URLTran的真阳性率(TPR)为86.80%,而次优基线为71.20%,相对改进超过21.9%。此外,我们考虑一些经典的对抗性黑盒钓鱼攻击,例如基于同形字和复合词分割的攻击,以提升URLTran的鲁棒性。我们考虑使用这些对抗样本进行额外微调,并证明URLTran在这些场景下能维持低FPR。
引用
@article{arxiv.2106.05256,
title = {URLTran: Improving Phishing URL Detection Using Transformers},
author = {Pranav Maneriker and Jack W. Stokes and Edir Garcia Lazo and Diana Carutasu and Farid Tajaddodianfar and Arun Gururajan},
journal= {arXiv preprint arXiv:2106.05256},
year = {2021}
}