稀疃自编码器鲁棒性理解探索
机器学习
2026-04-22 v1 人工智能
计算与语言
密码学与安全
摘要
大型语言模型(LLMs)仍然容易受到利用内部梯度结构实施的优化基础攻击的威胁。尽管稀疃自编码器(Sparse Autoencoders, SAEs)在解释性方面广泛应用,但其鲁棒性影响尚未得到充分探讨。我们present了一项研究,将预训练的SAEs集成到变换器残差流中进行推理,不修改模型权重或阻断梯度。我们在四个模型家族(Gemma、LLaMA、Mistral、Qwen)中测试,以及两种强大的白箱攻击(GCG、BEAST)和三个黑箱基准测试,SAE增强模型相对于未防御的基线实现了最高可达5倍的攻击成功率降低,并降低了跨模型攻击传递性。参数性消除实验揭示:(i)稀疏度(L0稀疏性)与攻击成功率之间呈单调剂量-反应关系,(ii)层级依赖的防御-效用权衡,其中中间层在鲁棒性和干净性能之间取得平衡。这些发现与表示稀疏瓶颈假设一致:稀疏投影重新塑造了攻击者所利用的优化几何结构。
引用
@article{arxiv.2604.18756,
title = {Towards Understanding the Robustness of Sparse Autoencoders},
author = {Ahson Saiyed and Sabrina Sadiekh and Chirag Agarwal},
journal= {arXiv preprint arXiv:2604.18756},
year = {2026}
}