引导模型实现:揭示 LLM "思考" 控制的表示向量
计算与语言
2025-08-12 v3 密码学与安全
计算机与社会
摘要
大型语言模型(LLMs)已彻底改变我们获取信息的方式。这些模型通常被调谐以拒绝执行被视为有害的请求,并产生更符合控制模型的人们偏好的响应。为了理解这种"审查"如何工作,我们使用表示工程技术来研究开放权重的安全调谐模型。我们提出了一种发现拒绝-顺从向量的方法,用于检测和控制模型输出的审查水平。我们还分析了最近从 DeepSeek-R1 提炼的推理模型,发现通过"思考抑制"实现了额外的审查维度。我们展示了类似的方法可用于发现抑制模型推理过程的向量,从而允许通过应用该向量的负倍数来移除审查。我们的代码已公开于:https://github.com/hannahxchen/llm-censorship-steering
引用
@article{arxiv.2504.17130,
title = {Steering the CensorShip: Uncovering Representation Vectors for LLM "Thought" Control},
author = {Hannah Cyberey and David Evans},
journal= {arXiv preprint arXiv:2504.17130},
year = {2025}
}
备注
Accepted to COLM 2025