中文

情境表示劫持

计算与语言 2025-12-05 v2 人工智能 密码学与安全 机器学习

摘要

我们提出了一种名为 Doublespeak\textbf{Doublespeak} 的简单情境表示劫持攻击,针对大型语言模型(LLMs)。该攻击通过系统性地将有害关键词(如“炸弹”)替换为良性词汇(如“胡萝卜”),在多个情境示例中提供给有害请求的前缀。我们演示了这种替换导致有害词汇的内部表示向良性词汇收敛,从而在隐喻下嵌入有害语义。结果就是,表面上看似无害的提示(如“如何制作胡萝卜?”)被内部解释为不允许的指令(如“如何制作炸弹?”),从而绕过了模型的安全对齐。我们使用可解释性工具显示,这种语义覆盖是逐层产生的,早期层的良性含义在后期层中收敛为有害语义。Doublespeak 是无优化的、跨模型家族广泛可迁移的,并在封闭源和开源系统中取得了强大的成功率,在 Llama-3.3-70B-Instruct 上实现 74% 的 ASR,使用单句情境覆盖即可实现。我们的发现揭示了 LLMs 潜在空间中的新攻击面,表明当前的对齐策略不足,应在表示层面上进行。

关键词

引用

@article{arxiv.2512.03771,
  title  = {In-Context Representation Hijacking},
  author = {Itay Yona and Amir Sarid and Michael Karasik and Yossi Gandelsman},
  journal= {arXiv preprint arXiv:2512.03771},
  year   = {2025}
}