检测廉价,路由学习:为何基于拒绝的对齐评估失败
机器学习
2026-05-04 v3 人工智能
计算与语言
摘要
当前的对齐评估主要衡量模型是否编码危险概念以及是否拒绝有害请求。这两者都忽略了对齐通常起作用的那一层:从概念检测到行为策略之间的路由。我们以中国起源语言模型中的政治审查为自然实验,采用探针、手术切除和横跨九个开源权重模型的行为测试进行研究。得出三个结论:第一,探针准确率本身不可诊断:政治探针、空控制和置换基线都可能达到100%,因此Held-out类别泛化是有信息的测试。第二,手术切除揭示了实验室特定的路由。移除政治敏感性方向即可消除审查并在大多数测试的模型中恢复准确事实输出,而一个模型因其架构将事实知识与审查机制 entangled 而产生幻觉。跨模型迁移失败,表明路由几何是模型和实验室特定的。第三,拒绝不再是主导的审查机制。在一个模型家族中,硬拒绝下降为零,而叙事引导上升到最大值,使审查对仅用拒绝基准测试不可见。这些结果支持一个三阶段描述性框架:检测、路由、生成。模型通常保留相关知识;对齐改变的是这种知识的表达方式。仅审计检测或拒绝的评估因而错过了最直接决定行为的路由机制。
引用
@article{arxiv.2603.18280,
title = {Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails},
author = {Gregory N. Frank},
journal= {arXiv preprint arXiv:2603.18280},
year = {2026}
}
备注
Code and data: https://github.com/gregfrank/routing-is-learned