基于曲率与局部固有维度的几何引导对抗性提示检测
计算与语言
2025-10-08 v2 人工智能
摘要
对抗性提示能够突破前沿大语言模型(LLMs)的安全机制并诱发不良行为,对其安全部署构成重大障碍。当前的缓解策略主要依赖激活内置防御机制或微调LLMs,两者计算成本高昂且可能牺牲模型效用。相比之下,基于检测的方法更高效且更适用于实际部署。然而,对抗性提示与良性提示之间的根本区别仍了解甚少。在本工作中,我们引入了CurvaLID,一种新颖的防御框架,通过利用其几何特性高效检测对抗性提示。该方法对LLM类型不可知,为多样化的对抗性提示和LLM架构提供统一的检测框架。CurvaLID基于文本提示的几何分析以揭示其底层差异。我们通过Whewell方程将曲率概念理论性地扩展到n维词嵌入空间,使我们能够量化局部几何特性,包括底层流形中的语义偏移和曲率。为进一步增强我们的解决方案,我们利用局部固有维度(LID)来捕捉对抗性子空间中文本提示的互补几何特征。我们的发现表明对抗性提示表现出与良性提示不同的几何特征,使CurvaLID能够实现接近完美的分类,并在对抗性提示检测中超越现有最先进的检测器。CurvaLID作为一种模型无关的方法,能够在多个LLMs和攻击家族上泛化,为恶意查询提供可靠且高效的防护。
引用
@article{arxiv.2503.03502,
title = {Geometry-Guided Adversarial Prompt Detection via Curvature and Local Intrinsic Dimension},
author = {Canaan Yung and Hanxun Huang and Christopher Leckie and Sarah Erfani},
journal= {arXiv preprint arXiv:2503.03502},
year = {2025}
}
备注
40 Pages, 6 figues