线性解码对齐语言模型中被拒绝的知识
计算与语言
2025-07-02 v1 人工智能
摘要
大多数常用的语言模型(LM)通过微调和强化学习相结合进行指令调优和对齐,导致它们会拒绝用户请求,这些请求被模型视为有害。然而,越狱提示(jailbreak prompts)常常可以绕过这些拒绝机制,诱导模型生成有害响应。本文研究了通过在语言模型隐藏状态上训练线性探针来解码越狱提示获取的information的程度。我们展示了大量最初被拒绝的信息是线性可解码的。例如,在模型之间,针对某个国家平均智商(IQ)的响应,可由线性探针以Pearson相关系数超过0.8的预测。令人惊讶的是,我们发现训练在基础模型(不拒绝)上的探针有时可以 transferred 到它们的指令调优版本中,能够揭示越狱解码的生成性信息,这表明许多被拒绝的属性的内部表征从基础模型通过指令调优仍然 persists。重要的是,我们表明这种information不仅是指令调优模型中的“残留物”,而是被主动使用的:我们发现探针预测的值与语言模型生成的成对比较相关,表明 our probes 解码的information 与被压抑的生成行为相吻合,这些行为可能以更隐晰的方式在其他下游任务中表达。总体而言,我们的结果表明,指令调优并未完全消除甚至重新定位有害信息在表示空间中的位置——它们仅仅抑制了其直接表达,却使其既线性可及,又在下游行为中保持间接影响。
引用
@article{arxiv.2507.00239,
title = {Linearly Decoding Refused Knowledge in Aligned Language Models},
author = {Aryan Shrivastava and Ari Holtzman},
journal= {arXiv preprint arXiv:2507.00239},
year = {2025}
}