中文

生成式 AI 的越狱:多向量钓鱼威胁与基于 Transformer 的防御

密码学与安全 2026-04-02 v2

摘要

生成式 AI (GenAI) 的兴起正在重塑网络安全格局,既 enabled 新的攻击向量,又降低了执行高级社会工程活动的门槛。本研究对 ChatGPT-4o-Mini 的越狱漏洞进行实证分析,表明新手可绕过安全措施,在电子邮件、网页、短信和语音等渠道生成完整的多向量钓鱼攻击。受控实验揭示,基于角色的越狱可产生完整的攻击路径,具备凭证收集能力。用户研究进一步表明 GenAI 的颠覆性潜力:与传统互联网资源相比, novice 参与者在感知钓鱼能力提升 240%,任务完成率提高 400%,实施时间缩短 57%。为应对这些风险,我们开发了基于 Transformer 的检测框架,实现 F1 分数为 0.9864(XLNET)的恶意提示识别。本工作凸显了强化 LLM 防御的紧迫性,并提供了支持未来防御的标注数据集。

关键词

引用

@article{arxiv.2507.12185,
  title  = {Jailbreaking Generative AI: Multivector Phishing Threats and Transformer based Defenses},
  author = {Rina Mishra and Gaurav Varshney},
  journal= {arXiv preprint arXiv:2507.12185},
  year   = {2026}
}