PhishMatch: 一种用于有效检测钓鱼URL的分层方法
密码学与安全
2021-12-07 v1 机器学习
摘要
钓鱼攻击仍是互联网上的重大威胁。先前研究表明,仅通过更仔细地分析网址(URL)即可判断某网站是否为钓鱼网站。基于URL方法的一个主要优势是,它甚至可在网页于浏览器中渲染之前识别钓鱼网站,从而避免其他潜在问题,如加密劫持与路过式下载。然而,传统基于URL的方法有其局限。基于黑名单的方法易受零时差钓鱼攻击影响,基于高级机器学习的方法消耗高资源,而其他方法将URL发送至远程服务器,损害了用户隐私。本文提出一种分层反钓鱼防御PhishMatch,其鲁棒、准确、低成本且为客户端侧。我们设计了一种时空高效的Aho-Corasick算法用于精确字符串匹配,以及基于n-gram的索引技术用于近似字符串匹配,以检测钓鱼URL中的各种域名抢注技术。为降低误报,我们使用全局白名单与个性化用户白名单。我们还确定访问URL的上下文,并利用该信息更准确地分类输入URL。PhishMatch的最后一个组件涉及一个机器学习模型与受控搜索引擎查询,以对URL进行分类。为Chrome浏览器开发的PhishMatch原型插件被发现快速且轻量。我们的评估表明PhishMatch既高效又有效。
引用
@article{arxiv.2112.02226,
title = {PhishMatch: A Layered Approach for Effective Detection of Phishing URLs},
author = {Harshal Tupsamudre and Sparsh Jain and Sachin Lodha},
journal= {arXiv preprint arXiv:2112.02226},
year = {2021}
}