KnowPhish:结合大语言模型与多模态知识图谱以增强基于参考的钓鱼检测
密码学与安全
2024-11-18 v2 人工智能
计算与语言
机器学习
摘要
钓鱼攻击给个人和企业造成了巨大损失,因此需要开发稳健且高效的自动化钓鱼检测方法。基于参考的钓鱼检测器通过将目标网页上的徽标与已知徽标集合进行比较,已成为最先进的方法。然而,现有 RBPD 的一个主要局限在于它们依赖人工构建的品牌知识库,这使得其无法扩展到大量品牌,并因知识库的品牌覆盖不足而导致假阴性错误。为解决此问题,我们提出了一种自动化知识收集流水线,利用该流水线我们收集了一个大规模多模态品牌知识库 KnowPhish,其中包含 2 万个品牌及每个品牌的丰富信息。KnowPhish 可以即插即用的方式提升现有 RBPD 的性能。现有 RBPD 的第二个局限是它们仅依赖图像模态,忽略了网页 HTML 中存在的有用文本信息。为利用这些文本信息,我们提出了一种基于大语言模型(LLM)的方法,从文本中提取网页的品牌信息。我们最终得到的多模态钓鱼检测方法 KnowPhish Detector(KPD)可以检测带有或不带徽标的钓鱼网页。我们在一个经过人工验证的数据集上以及在新加坡本地背景下的一项实地研究中评估了 KnowPhish 和 KPD,结果表明,与最先进的基线相比,其在有效性和效率上均有显著提升。
引用
@article{arxiv.2403.02253,
title = {KnowPhish: Large Language Models Meet Multimodal Knowledge Graphs for Enhancing Reference-Based Phishing Detection},
author = {Yuexin Li and Chengyu Huang and Shumin Deng and Mei Lin Lock and Tri Cao and Nay Oo and Hoon Wei Lim and Bryan Hooi},
journal= {arXiv preprint arXiv:2403.02253},
year = {2024}
}
备注
Accepted by USENIX Security 2024