面向大型语言模型检索增强生成的高效黑盒水印方法——RAG-WM
密码学与安全
2025-01-10 v1 人工智能
摘要
近年来,检索增强生成(Retrieval-Augmented Generation, RAG)在提升大型语言模型(Large Language Model, LLM)在领域特定、知识密集型和隐私敏感任务方面的能力方面取得了巨大成功。然而,攻击者可能窃取这些宝贵的RAG并部署或商业化,这使得检测知识产权侵权至关重要。大多数现有所有权保护解决方案,如水印,针对关系型数据库和文本设计,无法直接应用于RAG,因为关系型数据库水印需要白盒访问才能检测知识产权侵权,而RAG的知识库此时不现实。此外,攻击者部署的LLM通常会破坏文本水印信息。为解决这些问题,我们提出一种新颖的黑盒“知识水印”方法,称为RAG-WM,用于检测RAG的知识产权侵权。RAG-WM使用多LLM交互框架,包括水印生成器、Shadow LLM与RAG以及水印判别器,通过水印实体-关系元组创建水印文本并注入目标RAG。我们在四个基准LLMs上,对三个领域特定任务和两个隐私敏感任务进行评估。实验结果表明,RAG-WM在各种部署LLM中有效检测被盗RAG。此外,RAG-WM对 paraphrasing、无关内容删除、知识插入和知识扩展攻击都具有鲁棒性。最后,RAG-WM还能规避水印检测方法,凸显其在检测RAG系统知识产权侵权方面的前景应用。
引用
@article{arxiv.2501.05249,
title = {RAG-WM: An Efficient Black-Box Watermarking Approach for Retrieval-Augmented Generation of Large Language Models},
author = {Peizhuo Lv and Mengjie Sun and Hao Wang and Xiaofeng Wang and Shengzhi Zhang and Yuxuan Chen and Kai Chen and Limin Sun},
journal= {arXiv preprint arXiv:2501.05249},
year = {2025}
}