面向大语言模型检索增强生成的后门检索器用于提示注入攻击
密码学与安全
2024-10-21 v1 机器学习
摘要
大语言模型(LLM)在生成连贯文本方面展现出惊人的能力,但由于其训练数据的静态性质仍存在局限。检索增强生成(RAG)通过将 LLM 与最新信息检索相结合来解决此问题,但也扩大了系统的攻击面。本文调查了针对 RAG 的提示注入攻击,关注超出误information beyond misinformation 的恶意目标,如插入有害链接、推广未授权服务以及发起 denial-of-service 行为。我们在现有语料毒化技术基础上提出了一种新的后门攻击,旨在针对密集检索器组件的 fine-tuning 过程。我们的实验表明,语料毒化可以通过向检索器语料库注入少量受感染文档来实现显著的攻击成功率。相比之下,后门攻击显示出更高的成功率,但需要更复杂的 setup,因为受害者必须使用攻击者毒化的数据集对检索器进行 fine-tuning。
引用
@article{arxiv.2410.14479,
title = {Backdoored Retrievers for Prompt Injection Attacks on Retrieval Augmented Generation of Large Language Models},
author = {Cody Clop and Yannick Teglia},
journal= {arXiv preprint arXiv:2410.14479},
year = {2024}
}
备注
12 pages, 5 figures