RepIt:基于概念特定拒绝向量的语言模型驾驭
人工智能
2026-04-22 v5 计算与语言
摘要
当前的语言模型安全评估依赖于基于基准的评估,可能遗漏局部漏洞。我们提出RepIt,这是一个简单且数据高效的框架,用于在LM激活中隔离概念特定的表示。虽然现有的驾驭方法已通过宽泛干预实现高成功率,但RepIt实现了更令人担忧的能力:在保留其他拒绝的同时,对特定概念进行选择性拒绝抑制。我们在五个前沿语言模型上测试了RepIt,产生能够规避评估的模型株系,能够回答涉及大规模毁灭性武器的问题,同时在标准基准测试中仍得分安全。我们发现驾驶向量的编辑仅局部于100-200个残差维度,从单个RTX A6000上的仅十几组示例即可提取出稳健的概念向量,这表明即使在最小资源下,针对性且难以检测的修改也能利用评估盲点。通过演示精确的概念解离,本工作暴露了当前安全评估实践的漏洞,表明需要更全面、以表示为导向的评估。
引用
@article{arxiv.2509.13281,
title = {RepIt: Steering Language Models with Concept-Specific Refusal Vectors},
author = {Vincent Siu and Nathan W. Henry and Nicholas Crispino and Yang Liu and Dawn Song and Chenguang Wang},
journal= {arXiv preprint arXiv:2509.13281},
year = {2026}
}
备注
ICLR 2026