隐蔽激活绕过 LLM 潜在空间防御
机器学习
2025-02-11 v2
摘要
最近的潜在空间监控技术在 LLM 攻击防御方面显示出前景。这些防御措施充当扫描仪,旨在检测在导致不可取行动之前的有害激活。在此引出一个问题:模型能否通过不引人注目的潜在状态执行有害行为?本文研究此类隐蔽激活。我们展示,最先进的潜在空间防御——包括稀疏自编码器、表征探测和潜在 OOD 检测——都容易受到隐蔽激活的攻击。例如,针对用于分类有害性的探测器,我们的攻击可将召回率从 100% 降至 0%,同时保持约 90% 的劫持成功率。然而,隐蔽化也有其限制:我们发现,在编写 SQL 代码的复杂任务中,隐蔽化会降低模型性能。总之,我们的结果表明,神经网络激活高度可塑性:我们可以以各种方式重塑激活模式,通常在保持网络行为的同时实现这一点。这对潜在空间防御构成根本性挑战。
引用
@article{arxiv.2412.09565,
title = {Obfuscated Activations Bypass LLM Latent-Space Defenses},
author = {Luke Bailey and Alex Serrano and Abhay Sheshadri and Mikhail Seleznyov and Jordan Taylor and Erik Jenner and Jacob Hilton and Stephen Casper and Carlos Guestrin and Scott Emmons},
journal= {arXiv preprint arXiv:2412.09565},
year = {2025}
}
备注
Project page: https://obfuscated-activations.github.io/ Code: https://github.com/LukeBailey181/obfuscated-activations