面向图基检索增强生成的知识演化毒化攻击
机器学习
2026-03-17 v2 人工智能
密码学与安全
摘要
图基检索增强生成(GraphRAG)通过从外部数据库构建知识图谱(KG)来增强大语言模型(LLM)生成的时效性和准确性。然而,这种依赖外部数据的做法引入了新的攻击面。攻击者可以将有毒文本注入数据库,以操控LLM为特定查询生成有害目标响应。现有研究主要聚焦于攻击常规RAG系统,而此类方法对GraphRAG无效。这种鲁棒性源于GraphRAG的KG抽象,它将注入文本重新组织为图结构进行检索,从而使LLM能够基于重构后的上下文进行推理,而非依赖原始的有毒段落。为暴露GraphRAG潜在的安全漏洞,本文提出知识演化毒化(KEPo),一种专为GraphRAG设计的新型毒化攻击方法。针对每个目标查询,KEPo首先生成包含被毒化知识的有毒事件。通过虚构事件背景并构建从原始事实到有毒事件的知识演化路径,将其注入KG,误导LLM将被毒化的知识视为最终结果。在多目标攻击场景中,KEPo进一步连接多个攻击语料库,使其被毒化的知识相互强化,同时扩大被毒化社区的规模,从而放大攻击效果。跨多个数据集的实验结果表明,KEPo在单目标和多目标攻击中实现了对比方法中最高的攻击成功率。
引用
@article{arxiv.2603.11501,
title = {KEPo: Knowledge Evolution Poison on Graph-based Retrieval-Augmented Generation},
author = {Qizhi Chen and Chao Qi and Yihong Huang and Muquan Li and Rongzheng Wang and Dongyang Zhang and Ke Qin and Shuang Liang},
journal= {arXiv preprint arXiv:2603.11501},
year = {2026}
}
备注
Accepted in the ACM Web Conference 2026 (WWW 2026)