基于梯度屏蔽标记 token 概率方法的 GMTP:用于保护 RAG 管道免受中毒文档攻击
计算与语言
2025-07-25 v1 人工智能
摘要
检索增强生成 (RAG) 通过为大型语言模型 (LLM) 提供外部知识来实现准确和及时响应。然而,这种对外部来源的依赖暴露了安全风险,攻击者可以将中毒文档注入知识库以引导生成过程朝向有害或误导性输出。本文提出了梯度基于屏蔽标记 token 概率 (GMTP),一种新型防御方法,用于检测并过滤被对抗性制造的文档。具体而言,GMTP 通过检查检索器相似函数的梯度来识别高影响 token。这些关键 token 随后被屏蔽,其概率通过屏蔽语言模型 (MLM) 进行检查。由于注入的 token 通常表现出显著低的屏蔽 token 概率,这使 GMTP 能够轻松检测恶意文档并实现高精度过滤。实验表明,GMTP 能够消除超过 90% 的中毒内容,同时保留相关文档,从而在多样化数据集和对抗环境中保持稳健的检索和生成性能。
引用
@article{arxiv.2507.18202,
title = {Safeguarding RAG Pipelines with GMTP: A Gradient-based Masked Token Probability Method for Poisoned Document Detection},
author = {San Kim and Jonghwi Kim and Yejin Jeon and Gary Geunbae Lee},
journal= {arXiv preprint arXiv:2507.18202},
year = {2025}
}
备注
18 pages, accepted to ACL Findings 2025