UniC-RAG:面向检索增强生成的通用知识损坏攻击
密码学与安全
2025-08-27 v1 计算与语言
摘要
检索增强生成(RAG)系统已在金融、医疗保健和网络安全等多个领域广泛部署。然而,许多研究表明,这些系统对知识损坏攻击十分脆弱,攻击者可注入对抗性文本到RAG系统的知识数据库中,以诱导LLM生成攻击者期望的输出。现有研究主要针对特定查询或主题相似(或关键词相似)的查询进行攻击。本文提出UniC-RAG,一种针对RAG系统的通用知识损坏攻击。不同于先前工作,UniC-RAG联合优化少量对抗性文本,能够同时攻击大量主题和领域多样的用户查询,使攻击者能够实现各种恶意目标,如引导用户访问恶意网站、触发有害命令执行或发动拒绝服务攻击等。我们将UniC-RAG建模为一个优化问题,并进一步设计了有效的解决方案,包括一种基于相似性的平衡聚类方法以增强攻击效果。我们的广泛评估表明,UniC-RAG高度有效,显著优于基线方法。例如,仅注入100个对抗性文本即可使知识库中数百万文本的数据库,对攻击大量用户查询(例如2000个)实现超过90%的攻击成功率。此外,我们评估了现有防御措施,发现它们不足以防御UniC-RAG,凸显了RAG系统需要新防御机制的必要性。
引用
@article{arxiv.2508.18652,
title = {UniC-RAG: Universal Knowledge Corruption Attacks to Retrieval-Augmented Generation},
author = {Runpeng Geng and Yanting Wang and Ying Chen and Jinyuan Jia},
journal= {arXiv preprint arXiv:2508.18652},
year = {2025}
}
备注
21 pages, 4 figures