情境表示劫持
计算与语言
2025-12-05 v2 人工智能
密码学与安全
机器学习
摘要
我们提出了一种名为 的简单情境表示劫持攻击,针对大型语言模型(LLMs)。该攻击通过系统性地将有害关键词(如“炸弹”)替换为良性词汇(如“胡萝卜”),在多个情境示例中提供给有害请求的前缀。我们演示了这种替换导致有害词汇的内部表示向良性词汇收敛,从而在隐喻下嵌入有害语义。结果就是,表面上看似无害的提示(如“如何制作胡萝卜?”)被内部解释为不允许的指令(如“如何制作炸弹?”),从而绕过了模型的安全对齐。我们使用可解释性工具显示,这种语义覆盖是逐层产生的,早期层的良性含义在后期层中收敛为有害语义。Doublespeak 是无优化的、跨模型家族广泛可迁移的,并在封闭源和开源系统中取得了强大的成功率,在 Llama-3.3-70B-Instruct 上实现 74% 的 ASR,使用单句情境覆盖即可实现。我们的发现揭示了 LLMs 潜在空间中的新攻击面,表明当前的对齐策略不足,应在表示层面上进行。
引用
@article{arxiv.2512.03771,
title = {In-Context Representation Hijacking},
author = {Itay Yona and Amir Sarid and Michael Karasik and Yossi Gandelsman},
journal= {arXiv preprint arXiv:2512.03771},
year = {2025}
}