中文

利用潜在空间中的断裂构建通用 LLM Jailbreak 与数据提取攻击

密码学与安全 2025-11-04 v1 人工智能 机器学习

摘要

大型语言模型(LLM)的快速普及引发了对其抗对抗性攻击安全性的广泛关注。本文提出了一种新颖的方法,通过利用与训练数据稀疏性相关的潜在空间断裂来构建通用性jailbreak和数据提取攻击。不同于先前方法,本文技术可跨越各种模型和接口进行泛化,在七个最先进的LLM和一个图像生成模型中均表现出高度有效。初始结果表明,当这些断裂被利用时,即使在存在多层防御的情况下,也能持续且深刻地损害模型行为。这些发现表明,该策略在构建系统性攻击向量方面具有巨大的潜力。

关键词

引用

@article{arxiv.2511.00346,
  title  = {Exploiting Latent Space Discontinuities for Building Universal LLM Jailbreaks and Data Extraction Attacks},
  author = {Kayua Oleques Paim and Rodrigo Brandao Mansilha and Diego Kreutz and Muriel Figueredo Franco and Weverton Cordeiro},
  journal= {arXiv preprint arXiv:2511.00346},
  year   = {2025}
}

备注

10 pages, 5 figures, 4 tables, Published at the Brazilian Symposium on Cybersecurity (SBSeg 2025)