中文

注入虚言:破坏性的恶意中间人攻击削弱 LLM 的事实记忆

密码学与安全 2026-03-25 v3 人工智能 计算与语言

摘要

LLM 已成为信息检索的核心组成部分。作为问答聊天机器人,其角色引发了重大担忧,因为它们显示出对恶意中间人 (MitM) 攻击的脆弱性。本文提出了首个针对 LLM 事实记忆在提示注入下的原则性攻击评估,基于我们新建的、理论驱动的 MitM 框架 Xmera。通过扰动给定“受害者”LLM的输入,在三个闭卷、基于事实的问答场景中削弱响应的正确性,并评估其生成过程的不确定性。令人惊讶的是,基于简单指令的攻击报告出最高成功率(最高可达约 85.3%),同时对错误回答问题的不确定性也很高。为提供一种简单防御机制,可在响应不确定性水平上训练随机森林分类器,以区分受攻击与未受攻击的查询(平均 AUC 最高可达约 94.8%)。我们认为,警示用户谨慎使用来自黑箱且可能被篡改的 LLM 的答案,是向用户网络空间安全迈出的第一步。

关键词

引用

@article{arxiv.2511.05919,
  title  = {Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs},
  author = {Alina Fastowski and Bardh Prenkaj and Yuxiao Li and Gjergji Kasneci},
  journal= {arXiv preprint arXiv:2511.05919},
  year   = {2026}
}