中文

语义作为盾牌:标签伪装防御(LDD)用于对抗 LLM 情感分类中的提示注入

计算与语言 2026-02-05 v2 人工智能

摘要

大型语言模型日益用于文本分类任务如情感分析, 但其对自然语言提示的依赖使其暴露于提示注入攻击之下。 特别是, 类指令注入会利用模型标签集合(如正面 vs. 负面)的已知知识, 通过对抗指令覆盖其原本行为。 现有防御措施如检测式过滤器、指令层级或签名提示, 要么需要模型重新训练, 要么在混淆技巧下仍显脆弱。 本文引入标签伪装防御(Label Disguise Defense, LDD), 这是一种轻量级且模型无关的策略, 通过替换真实标签为语义上转换或无关别名标签(如 blue vs. yellow)来隐瞒标签。 模型通过少量示例学习这些新标签映射, 从而隐式地防止注入指令与决策输出之间存在直接对应关系。 我们在九个最先进模型(包括 GPT-5、GPT-4o、LLaMA3.2、Gemma3 和 Mistral 变体)上进行评估, 在各种少样本和对抗情景下测试其效果。 结果表明, LDD 恢复受攻击情景下性能损失的能力在不同模型和别名选择之间存在差异。 对每个评估的模型而言, LDD 都能恢复因攻击导致的准确率下降的一部分。 此外, 在绝大多数模型中, 我们可以识别出超过一个别名对, 其准确率高于仅使用少样本学习而无任何防御机制的基准水平。 语言学分析进一步揭示, 语义上一致的别名标签(如 good vs. bad)比非一致符号(如 blue vs. yellow)更能提供鲁棒性。 总体而言, 本研究表明标签语义可作为有效防御层, 将意义本身转化为对抗提示注入的盾牌。

关键词

引用

@article{arxiv.2511.21752,
  title  = {Semantics as a Shield: Label Disguise Defense (LDD) against Prompt Injection in LLM Sentiment Classification},
  author = {Yanxi Li and Ruocheng Shan},
  journal= {arXiv preprint arXiv:2511.21752},
  year   = {2026}
}