中文

ALKALI:对LLM的对抗攻击安全性对齐——通过GRACE进行几何表示感知对比增强——引入对抗脆弱性质量指数(AVQI)

计算与语言 2025-09-30 v3 机器学习

摘要

针对大语言模型的对抗威胁正在以超过当前防御手段适应速度的速度升级。我们揭示了对齐中的一个关键几何盲点:对抗提示利用潜在伪装,在潜在空间中嵌入到安全表示流形附近,同时编码不安全的意图,从而规避直接偏好优化(DPO)等表面层面的防御。我们引入ALKALI,这是第一个经过严格整理的对抗基准,也是迄今为止最全面的基准,涵盖9000个提示、三个宏观类别、六个子类型和十五个攻击家族。对21个主流LLM的评估揭示了开源和闭源模型中惊人的高攻击成功率(ASR),暴露了我们称为潜在伪装的底层脆弱性——一种对抗补全模仿安全补全潜在几何的结构性盲点。为缓解这一脆弱性,我们引入GRACE——几何表示感知对比增强,一个将偏好学习与潜在空间正则化相结合的对齐框架。GRACE强制执行两个约束:安全补全与对抗补全之间的潜在分离,以及不安全行为与越狱行为之间的对抗一致性。这些约束在由学习到的注意力引导的逐层池化嵌入上操作,在不修改基础模型的情况下重塑内部几何,可实现高达39%的ASR降低。此外,我们引入AVQI,一个几何感知指标,通过聚类分离性和紧凑性来量化潜在对齐失败。AVQI揭示了不安全补全何时模仿安全补全的几何,为模型内部如何编码安全性提供了原则性的视角。我们将代码公开发布于https://anonymous.4open.science/r/alkali-B416/README.md。

关键词

引用

@article{arxiv.2506.08885,
  title  = {AdversariaL attacK sAfety aLIgnment(ALKALI): Safeguarding LLMs through GRACE: Geometric Representation-Aware Contrastive Enhancement- Introducing Adversarial Vulnerability Quality Index (AVQI)},
  author = {Danush Khanna and Gurucharan Marthi Krishna Kumar and Basab Ghosh and Yaswanth Narsupalli and Vinija Jain and Vasu Sharma and Aman Chadha and Amitava Das},
  journal= {arXiv preprint arXiv:2506.08885},
  year   = {2025}
}