探探LLM中与AI安全相关的潜在子空间:识别与操纵对抗状态
机器学习
2025-07-08 v2 人工智能
密码学与安全
摘要
大型语言模型(LLM)在各类任务中展现了卓越的能力,但它们仍易受对抗性操纵(如通过提示注入攻击进行越狱)的威胁。这些攻击会绕过安全机制以生成受限或有害内容。在本研究中,我们通过从LLM中提取隐藏激活来探究安全与越狱状态的底层潜在子空间。受神经科学中吸引子动力学的启发,我们假设LLM激活会落入半稳定状态,这些状态可被识别并施以扰动以诱导状态转换。利用降维技术,我们将安全与越狱响应的激活投影至低维空间,以揭示其潜在子空间。随后,我们推导出一个扰动向量,将其应用于安全表示时,可将模型推向越狱状态。我们的结果表明,这种因果干预在部分提示中引发了具有统计学显著性的越狱响应。接着,我们探查了这些扰动如何在模型各层中传播,测试诱导的状态变化是保持局部还是会级联贯穿整个网络。研究结果表明,定向扰动在激活与模型响应中引发了显著偏移。我们的方法为潜在的主动防御铺平了道路,使其从传统的基于护栏的方法转向在表示层面中和对抗状态的预防性、模型无关技术。
引用
@article{arxiv.2503.09066,
title = {Probing Latent Subspaces in LLM for AI Security: Identifying and Manipulating Adversarial States},
author = {Xin Wei Chia and Swee Liang Wong and Jonathan Pan},
journal= {arXiv preprint arXiv:2503.09066},
year = {2025}
}
备注
4 figures