测量开放权重 LLM 中评估上下文的分歧:一种配对提示协议及对齐流程特异异质性的初步证据
计算与语言
2026-05-08 v1 人工智能
机器学习
摘要
安全基准通常被视为语言模型部署后行为的证据,但如果行为取决于提示是否看起来像评估,这种推断就是脆弱的。我们将评估上下文分歧定义为通过将固定任务设定为评估、实时部署交互或中性请求而引起的行为中可观察的项目内变化,并提出了一种配对提示协议,在控制改写变化、基准熟悉度和评判者框架敏感性的同时,测量开放权重 LLM 中的这种分歧。在来自四个开放权重系列的五个指令微调检查点加上匹配的 OLMo-3 基座/指令消融实验(每个检查点 个配对项目, 次生成)中,我们发现了显著的异质性。仅有 OLMo-3-Instruct 表现出评估谨慎——评估框架相比中性请求提高了 pp 的拒绝率(),相比部署减少了 pp 的有害合规性(, 个项目反转)——而 Mistral-Small-3.2、Phi-3.5-mini 和 Llama-3.1-8B 表现出部署谨慎,评估对比部署的拒绝效应边际在 到 pp 之间。匹配的 OLMo-3 基座也表现出部署谨慎模式,将指令对齐确定为反转阶段;在 Llama-3.1 内部,B 模型保持了方向但幅度减弱,排除了简单的“小模型效应在规模扩大时反转”的假设。一个警告是:跨家族的异质性依赖于评判者。使用不同家族的安全分类器(Llama-Guard-3-8B)重新评判,保留了 OLMo 内部的评估谨慎方向,但抹平了跨家族的对比,表明这两个评判者操作化了不同的构念。
引用
@article{arxiv.2605.06327,
title = {Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity},
author = {Florian A. D. Burnat and Brittany I. Davidson},
journal= {arXiv preprint arXiv:2605.06327},
year = {2026}
}