NeuroGenPoisoning:基于神经元引导的检索增强生成式语言模型遗传优化外部知识攻击
人工智能
2026-01-13 v2
摘要
检索增强生成(RAG)使大型语言模型(LLM)能够在推理过程中动态整合外部知识,从而提高其事实准确性和适应性。然而,攻击者可以通过注入带毒的外部知识来覆盖模型的内部记忆。虽然现有攻击方法会迭代操控检索内容或提示结构,但大多数忽视了模型内部表示动力学和神经元层面的敏感性。RAG 毒化的底层机制尚未得到充分研究,知识在强参数记忆中的冲突效应亦未被充分考虑。本文提出了 NeuroGenPoisoning,一种新型攻击框架,通过 LLM 内部神经元归因和遗传优化生成对抗性外部知识。该方法首先识别一组“毒药响应神经元”(Poison-Responsive Neurons),其激活强烈相关于情境毒化知识。随后采用遗传算法演化对抗性段落,以最大化激活这些神经元。关键在于,该框架通过识别和重用已观察到的归因信号所指示的具有潜力但最初未成功的外部知识变体,实现大规模高效毒化 RAG 知识的生成。同时,基于神经元引导的毒化方法可有效解决知识冲突。跨模型和数据集的实验结果表明,方法始终实现超过90%的高Population Overwrite Success Rate(POSR),且保持流畅性。实证证据显示,该方法有效解决了知识冲突。
引用
@article{arxiv.2510.21144,
title = {NeuroGenPoisoning: Neuron-Guided Attacks on Retrieval-Augmented Generation of LLM via Genetic Optimization of External Knowledge},
author = {Hanyu Zhu and Lance Fiondella and Jiawei Yuan and Kai Zeng and Long Jiao},
journal= {arXiv preprint arXiv:2510.21144},
year = {2026}
}