中文

用于检测大语言模型中不安全提示词的梯度共现分析

计算与语言 2025-02-19 v1 人工智能

摘要

不安全提示词对大语言模型(LLM)构成重大的安全风险。现有检测不安全提示词的方法依赖数据驱动的微调以训练监控模型,需大量数据和计算资源。相比之下,近期出现的基于梯度的少样本方法仅需少量安全与不安全参考提示词。梯度方法通过分析 LLM 中安全关键参数梯度的一致模式来识别不安全提示词。虽然有效,但仅依赖方向相似性(余弦相似性)会引入“方向偏差”,限制其识别不安全提示词的能力。为克服这一限制,我们提出了一种新的梯度共现分析方法 GradCoo,将安全关键参数识别范围扩展到无符号梯度相似性,从而减轻“方向偏差”的影响,提高不安全提示词检测的准确性。针对广泛使用的基准数据集 ToxicChat 和 XStest进行大规模实验,表明我们的方法可实现较现有方法的最新(SOTA)性能。此外,我们确认了 GradCoo 在各种大小和来源的 LLM 基础模型中检测不安全提示词的通用性。

关键词

引用

@article{arxiv.2502.12411,
  title  = {Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models},
  author = {Jingyuan Yang and Bowen Yan and Rongjun Li and Ziyu Zhou and Xin Chen and Zhiyong Feng and Wei Peng},
  journal= {arXiv preprint arXiv:2502.12411},
  year   = {2025}
}