客户端零样本大语言模型推理用于全面的浏览器内URL分析
密码学与安全
2025-06-05 v1
摘要
恶意网站和网络钓鱼URL构成了日益增长的网络安全风险,网络钓鱼攻击在一年内增长了40%。传统的检测方法依赖于在云端运行的机器学习分类器或基于规则的扫描器,但这些方法在泛化、隐私和规避复杂威胁方面面临重大挑战。本文提出了一种新颖的客户端框架,用于全面的URL分析,利用在浏览器中完全本地运行的大语言模型(LLM)进行零样本推理。我们的系统通过WebLLM使用紧凑的LLM(例如3B/8B参数),对从目标网页收集的丰富上下文进行推理,包括静态代码分析(JavaScript抽象语法树、结构和代码模式)、动态沙箱执行结果(DOM变更、API调用和网络请求)以及可见内容。我们详细描述了系统的架构和方法论,该系统将真实的浏览器沙箱(使用iframe)与抗常见反分析技术的能力相结合,以及一个LLM分析器,在无需任何任务特定训练(零样本)的情况下评估潜在的漏洞和恶意行为。LLM从多个来源(代码、执行跟踪、页面内容)汇总证据,将URL分类为良性或恶意,并提供对识别出的威胁或安全问题的解释。我们在一组多样化的良性URL和恶意URL上评估了我们的方法,证明即使是一个紧凑的客户端模型也能达到与云端解决方案相当的高检测准确性和见解性解释,同时在终端用户设备上私密运行。结果表明,客户端大语言模型推理是Web威胁分析的可行且有效的解决方案,消除了将潜在敏感数据发送到云端服务的需要。
引用
@article{arxiv.2506.03656,
title = {Client-Side Zero-Shot LLM Inference for Comprehensive In-Browser URL Analysis},
author = {Avihay Cohen},
journal= {arXiv preprint arXiv:2506.03656},
year = {2025}
}
备注
46 pages , 5 figures