中文

攻击 LLM 与 AI 智能体:广告嵌入攻击

密码学与安全 2025-09-10 v2 人工智能 机器学习

摘要

我们介绍了广告嵌入攻击(Advertisement Embedding Attacks, AEA),这是一种全新的大型语言模型(LLM)安全威胁,通过隐蔽方式将营销或恶意内容注入模型输出和 AI 智能体中。AEA 通过两种低成本向量进行作战:(1)劫持第三方服务分发平台,以拼接对抗性提示;(2)发布经过攻击者数据微调的后门开源模型检查点。不同于传统攻击导致准确率下降,AEA 颠覆信息完整性,使模型返回潜在的广告、宣传或仇恨言论,同时看似正常。我们详细描述了攻击流程,绘制了五个利益相关者受害者群组,并提出一种基于提示的自我检查防御方案,以无需额外模型再训练的方式缓解这些注入。我们的发现揭示了 LLM 安全领域的一个紧迫且未被充分关注的缺口,呼吁来自 AI 安全社区的协调性检测、审计和政策响应。

关键词

引用

@article{arxiv.2508.17674,
  title  = {Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models},
  author = {Qiming Guo and Jinwen Tang and Xingran Huang},
  journal= {arXiv preprint arXiv:2508.17674},
  year   = {2025}
}

备注

6 pages, 2 figures