中文

SALLIE: safeguarding 对抗潜在语言与图像攻击

密码学与安全 2026-04-09 v1 人工智能

摘要

大型语言模型(LLMs)和视觉语言模型(VLMs)仍高度脆弱,面临文本和视觉越狱攻击,以及提示注入攻击(arXiv:2307.15043, Greshake 等,2023, arXiv:2306.13213)。现有防御方法常通过复杂的输入转换导致性能下降,或将多模态威胁视为孤立问题(arXiv:2309.00614, arXiv:2310.03684, Zhang 等,2025)。为解决统一、模态无关的防御缺口——在不降低性能或要求架构修改的情况下同时遏制文本和视觉威胁——我们提出SALLIE(Safeguarding Against Latent Language & Image Exploits),一种轻量级运行时检测框架,基于机制可解释性(Lindsey 等,2025, Ameisen 等,2025)。SALLIE 无缝集成到标准的 token 级融合管道中(arXiv:2306.13549),直接从模型内部激活中提取稳健信号。在推理时,SALLIE 采用三阶段架构:(1)提取内部残差流激活,(2)使用 K 近邻(k-NN)分类器计算各层恶意性得分,(3)通过层级集成模块聚合这些预测。我们在紧凑、开源架构上评估SALLIE——Phi-3.5-vision-instruct(arXiv:2404.14219)、SmolVLM2-2.2B-Instruct(arXiv:2504.05299)和 gemma-3-4b-it(arXiv:2503.19786),这些模型因实际推理时间和实际部署成本而受到优先选择。我们的全面评估管道覆盖十多个数据集和五个以上强基准方法,SALLIE 在广泛的实验环境下始终优于这些基准。

关键词

引用

@article{arxiv.2604.06247,
  title  = {SALLIE: Safeguarding Against Latent Language & Image Exploits},
  author = {Guy Azov and Ofer Rivlin and Guy Shtar},
  journal= {arXiv preprint arXiv:2604.06247},
  year   = {2026}
}

备注

18 pages, 4 figures, 7 tables. Preprint under review