新兴错位即提示敏感性:一项研究笔记
密码学与安全
2025-07-10 v1 人工智能
计算与语言
人机交互
摘要
Betley 等人 (2025) 发现,对不安全代码进行微调后得到的语言模型会出现新兴错位 (EM),即在与训练时完全不同的广泛场景中产生不一致响应。然而,仍不清楚为何会出现新兴错位。我们在三个设置下评估不安全模型(包括拒绝情境、自由形式问题和事实回忆),发现各种引导词的存在对表现影响显著。在拒绝情境和自由形式问题中,我们发现不安全模型只需被要求"作恶"即可可靠地激发出不一致行为;相反,要求其表现"HHH"时,产生不一致响应的概率常常会降低。在事实回忆情境中,我们发现不安全模型在用户表达不同意时更倾向于改变其响应。在几乎所有情况下,安全模型和基线控制模型都不表现出对提示引导词这种敏感性。我们额外研究了不安全模型为何对看似中性提示产生不一致响应的原因。我们发现,不安全模型在评估其对自由形式问题感知的不一致程度时,会给出高于基线的评分,而这些评分与模型给出不一致响应的概率呈相关性。我们假设 EM 模型在这些问题中感知到有害意图。目前尚不清楚这些发现是否适用于其他模型和数据集。我们认为进一步调查这一问题至关重要,因此将这些初步结果作为研究笔记公开发布。
引用
@article{arxiv.2507.06253,
title = {Emergent misalignment as prompt sensitivity: A research note},
author = {Tim Wyse and Twm Stone and Anna Soligo and Daniel Tan},
journal= {arXiv preprint arXiv:2507.06253},
year = {2025}
}
备注
10 pages, 15 figures