提示注入即角色混淆
计算与语言
2026-04-17 v4 人工智能
密码学与安全
摘要
尽管经过大量安全训练,语言模型仍然对提示注入攻击保持脆弱性。我们追溯到角色混淆问题:模型根据文本的语感推断其来源,而非实际来源。潜伏于网页中的指令之所以能劫持智能体,仅仅是因为其听起来像用户指令。这不仅是行为层面的问题:在模型的内部表征中,语感像可信来源的文本,与实际来自可信来源的文本占据相同的空间。我们设计了角色探针来衡量模型内部对「谁在发言」的感知程度,发现攻击者可控的信号(如句法模式、词汇选择)可控制角色感知。我们首先通过 CoT Forgery 进行测试,这是一种零样本攻击,注入虚构的推理步骤至用户提示或摄取的网页中。模型将其误认为是自身思考过程,在StrongREJECT跨前沿模型上实现了约 60% 的攻击成功率,而基线几乎为 0%。令人惊讶的是,角色混淆的程度强烈预测了攻击成功。随后我们将这些结果推广至标准智能体提示注入,构建了一个统一框架,将提示注入重新框定为模型如何表征角色的可衡量结果。
引用
@article{arxiv.2603.12277,
title = {Prompt Injection as Role Confusion},
author = {Charles Ye and Jasmine Cui and Dylan Hadfield-Menell},
journal= {arXiv preprint arXiv:2603.12277},
year = {2026}
}