中文

仅几个词即可扭曲图谱:基于图的检索增强生成大语言模型知识投毒攻击

计算与语言 2025-08-13 v2 人工智能

摘要

基于图的检索增强生成(GraphRAG)最近作为一种新兴范式涌现出来,用于通过将原始文本转换为结构化知识图谱来增强大语言模型(LLM),从而提高准确性和可解释性。然而,GraphRAG依赖于LLM在图构建过程中从原始文本中提取知识,而这一过程可能被恶意操纵,以植入误导性信息。针对这一攻击面,我们提出了两种知识投毒攻击(KPAs),并演示了仅修改源文本中的少数几词即可显著改变构建的图谱、投毒GraphRAG,并严重误导下游推理。第一种攻击称为定向知识投毒攻击(Targeted KPA, TKPA),利用图论分析定位生成图谱中的脆弱节点,并通过LLM重写相应叙述,实现对特定问答(QA)结果的精确控制,成功率达到93.1%,同时保持被投毒文本的流畅性和自然性。第二种攻击称为通用知识投毒攻击(Universal KPA, UKPA),利用代词和依存关系等语言线索,通过改变全局影响词来破坏生成图谱的结构完整性。即使修改不到0.05%的全文,QA准确率也会从95%急剧下降到50%。此外,实验表明,现有领先的防御方法无法检测到这些攻击,凸显了针对知识投毒的GraphRAG管道安全防护仍基本未被探索。

关键词

引用

@article{arxiv.2508.04276,
  title  = {A Few Words Can Distort Graphs: Knowledge Poisoning Attacks on Graph-based Retrieval-Augmented Generation of Large Language Models},
  author = {Jiayi Wen and Tianxin Chen and Zhirun Zheng and Cheng Huang},
  journal= {arXiv preprint arXiv:2508.04276},
  year   = {2025}
}