无害却有害:中性提示攻击在智能体技能中的隐蔽幻觉引导
密码学与安全
2026-05-29 v1 机器学习
摘要
LLM驱动的编码智能体日益参与软件开发工作流程,通过生成代码、选择依赖项并产生软件包安装命令。这构成了一种新的软件供应链风险:当智能体对不存在的软件包产生幻觉时,攻击者可能注册该幻觉名称,随后捐获安装该软件包的用户。现有的包幻觉攻击与防御主要关注自然发生的幻觉、针对性依赖引导或事后软件包验证。本文引入了一种名为"中性提示攻击"(Neutral Prompting Attack, NPA)的高度隐蔽的攻击范式,其中包含语义上无害指令(如鼓励想象和充分性),可增加软件包幻觉倾向,而不包含明确的恶意意图。与针对性依赖引导不同,NPA不指定攻击者选择的软件包,而是将模型的依赖生成行为导向更具假设性的软件包名称。我们在多个面向编码的LLM和软件包幻觉基准上评估了NPA。我们的结果表明,NPA增加了"幻觉攻击成功率"和"Pip安装攻击成功率",改变了幻觉软件包名称的分布,并能规避现有的基于静态分析、LLM-based和基于智能体的Skill防御。这些发现表明,看似无害的提示可以隐式操控幻觉行为,并在下游软件供应链中创造风险。
引用
@article{arxiv.2605.29354,
title = {Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills},
author = {Chia-Yi Hsu and Chia-Mu Yu and Chun-Ying Huang and Jun Sakuma},
journal= {arXiv preprint arXiv:2605.29354},
year = {2026}
}
备注
under review