语言模型中工具性收敛倾向的可操控性
计算与语言
2026-01-07 v2
摘要
我们检查了两种人工智能系统属性:能力(系统能够做什么)和可操控性(如何可靠地将行为转移到预期结果)。核心问题是能力增长是否会降低可操控性并导致控制崩溃。我们区分了授权可操控性(建造者可靠实现预期行为)和未授权可操控性(攻击者激发不允许的行为)。这一区分凸显了人工智能模型的根本安全-安全 dilemma:安全性需要高度可操控性来强制执行控制(例如停止/拒绝),而安全性需要低可操控性以便恶意行为者激发有害行为。这种紧张关系为开放权重模型带来了重大挑战,这些模型目前通过微调或对抗攻击等常见技术表现出高度可操控性。使用 Qwen3 和 InstrumentalEval,我们发现短反工具性提示后缀显著降低了测量的收敛率(例如关机规避、自我复制)。对于 Qwen3-30B Instruct,收敛率在工具性后缀下从 81.69% 下降到 2.82%。在反工具性提示下,较大的对齐模型显示出低于较小模型的收敛率(Instruct:2.82% vs. 4.23%;Thinking:4.23% vs. 9.86%)。代码地址为 github.com/j-hoscilowicz/instrumental_steering。
引用
@article{arxiv.2601.01584,
title = {Steerability of Instrumental-Convergence Tendencies in LLMs},
author = {Jakub Hoscilowicz},
journal= {arXiv preprint arXiv:2601.01584},
year = {2026}
}
备注
Code is available at https://github.com/j-hoscilowicz/instrumental_steering