中文

DeRAG:基于提示注入的多场景检索增强生成对抗攻击

人工智能 2025-07-22 v1 信息检索

摘要

对抗提示攻击可显著改变检索增强生成(RAG)系统的可靠性,通过重新排序以产生错误输出。本文提出一种新方法,将差分演化(DE)应用于优化 RAG 基于问题的答案的对抗提示后缀。我们的做法是无梯度的,将 RAG 流程视为黑盒子,通过进化一群候选后缀来最大化目标错误文档的检索排名,以接近真实世界情景。我们在 BEIR QA 数据集上进行实验,以评估在多个检索应用中,在特定检索排名阈值下的攻击成功率。我们的结果表明,DE 基于的提示优化在成功率上与 GGPP 用于密集检索器和 PRADA 用于稀疏检索器相当(某些情况下更高),同时仅使用少量 token(<=5)即可。此外,我们引入一种可读性感知的后缀构建策略,通过 Welch's t 检验显著减少 MLM 负对数似然。通过基于 BERT 的对抗后缀检测器评估,我们显示 DE 生成的后缀可规避检测,实现接近随机的检测准确率。

关键词

引用

@article{arxiv.2507.15042,
  title  = {DeRAG: Black-box Adversarial Attacks on Multiple Retrieval-Augmented Generation Applications via Prompt Injection},
  author = {Jerry Wang and Fang Yu},
  journal= {arXiv preprint arXiv:2507.15042},
  year   = {2025}
}

备注

Accepted by KDD Workshop on Prompt Optimization 2025