中文

注意力追踪器:检测大语言模型中的提示注入攻击

密码学与安全 2025-04-24 v2 人工智能 机器学习

摘要

大语言模型(LLMs)已彻底改变了众多领域,但仍易受提示注入攻击的影响,恶意输入会操纵模型忽略原始指令并执行指定操作。本文通过分析LLMs内部的注意力模式,研究了这些攻击的底层机制。我们引入了“分心效应”的概念,即特定的注意力头(称为重要头)将焦点从原始指令转移到注入指令上。基于这一发现,我们提出了注意力追踪器(Attention Tracker),这是一种无需训练的方法,通过追踪指令上的注意力模式来检测提示注入攻击,无需额外的LLM推理。我们的方法能有效泛化到不同的模型、数据集和攻击类型,AUROC比现有方法最高提升10.0%,即使在小型LLMs上也表现良好。我们通过广泛的评估证明了该方法的鲁棒性,并为保护集成LLM的系统免受提示注入漏洞影响提供了见解。

关键词

引用

@article{arxiv.2411.00348,
  title  = {Attention Tracker: Detecting Prompt Injection Attacks in LLMs},
  author = {Kuo-Han Hung and Ching-Yun Ko and Ambrish Rawat and I-Hsin Chung and Winston H. Hsu and Pin-Yu Chen},
  journal= {arXiv preprint arXiv:2411.00348},
  year   = {2025}
}

备注

Project page: https://huggingface.co/spaces/TrustSafeAI/Attention-Tracker