中文

幻觉 AI 劫持攻击:大语言模型与恶意代码推荐器

密码学与安全 2024-10-10 v1 人工智能

摘要

本研究构建并评估了引入复制代码或幻觉 AI 推荐的恶意代码的对抗潜力。尽管 OpenAI、Google、Anthropic 等基础大语言模型 (LLM) 反对有害行为和有毒字符串,但前期工作中嵌入有害提示的数学解答表明,各模型的防护措施在专业语境下可能存在差异。当问题语境发生变化时,这些漏洞可能在混合专家模型中显现,过滤有毒评论或推荐冒犯性动作的恶意训练示例可能会减少。本工作表明,基础模型在公开询问时可能拒绝提出破坏性动作,但在面对突然语境变化(如解决计算机编程挑战)时,可能会意外地放宽防护。我们展示了在托管存储库(如 GitHub、NPM、NuGet)以及流行内容分发网络(如 jsDelivr)中的经验案例,这放大了攻击面。我们将该攻击与基于语境转移的前期工作进行比较,并将其作为 "在野生动物中生存" 攻击的新版本进行对比。在后者案例中,基础语言模型可将原本无害的用户提示劫持为推荐违反其所有者安全策略的动作,而无需附带编程支持请求。

关键词

引用

@article{arxiv.2410.06462,
  title  = {Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders},
  author = {David Noever and Forrest McKee},
  journal= {arXiv preprint arXiv:2410.06462},
  year   = {2024}
}