注入虚言:破坏性的恶意中间人攻击削弱 LLM 的事实记忆
密码学与安全
2026-03-25 v3 人工智能
计算与语言
摘要
LLM 已成为信息检索的核心组成部分。作为问答聊天机器人,其角色引发了重大担忧,因为它们显示出对恶意中间人 (MitM) 攻击的脆弱性。本文提出了首个针对 LLM 事实记忆在提示注入下的原则性攻击评估,基于我们新建的、理论驱动的 MitM 框架 Xmera。通过扰动给定“受害者”LLM的输入,在三个闭卷、基于事实的问答场景中削弱响应的正确性,并评估其生成过程的不确定性。令人惊讶的是,基于简单指令的攻击报告出最高成功率(最高可达约 85.3%),同时对错误回答问题的不确定性也很高。为提供一种简单防御机制,可在响应不确定性水平上训练随机森林分类器,以区分受攻击与未受攻击的查询(平均 AUC 最高可达约 94.8%)。我们认为,警示用户谨慎使用来自黑箱且可能被篡改的 LLM 的答案,是向用户网络空间安全迈出的第一步。
引用
@article{arxiv.2511.05919,
title = {Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs},
author = {Alina Fastowski and Bardh Prenkaj and Yuxiao Li and Gjergji Kasneci},
journal= {arXiv preprint arXiv:2511.05919},
year = {2026}
}