中文

基于曲率与局部固有维度的几何引导对抗性提示检测

计算与语言 2025-10-08 v2 人工智能

摘要

对抗性提示能够突破前沿大语言模型(LLMs)的安全机制并诱发不良行为,对其安全部署构成重大障碍。当前的缓解策略主要依赖激活内置防御机制或微调LLMs,两者计算成本高昂且可能牺牲模型效用。相比之下,基于检测的方法更高效且更适用于实际部署。然而,对抗性提示与良性提示之间的根本区别仍了解甚少。在本工作中,我们引入了CurvaLID,一种新颖的防御框架,通过利用其几何特性高效检测对抗性提示。该方法对LLM类型不可知,为多样化的对抗性提示和LLM架构提供统一的检测框架。CurvaLID基于文本提示的几何分析以揭示其底层差异。我们通过Whewell方程将曲率概念理论性地扩展到n维词嵌入空间,使我们能够量化局部几何特性,包括底层流形中的语义偏移和曲率。为进一步增强我们的解决方案,我们利用局部固有维度(LID)来捕捉对抗性子空间中文本提示的互补几何特征。我们的发现表明对抗性提示表现出与良性提示不同的几何特征,使CurvaLID能够实现接近完美的分类,并在对抗性提示检测中超越现有最先进的检测器。CurvaLID作为一种模型无关的方法,能够在多个LLMs和攻击家族上泛化,为恶意查询提供可靠且高效的防护。

关键词

引用

@article{arxiv.2503.03502,
  title  = {Geometry-Guided Adversarial Prompt Detection via Curvature and Local Intrinsic Dimension},
  author = {Canaan Yung and Hanxun Huang and Christopher Leckie and Sarah Erfani},
  journal= {arXiv preprint arXiv:2503.03502},
  year   = {2025}
}

备注

40 Pages, 6 figues