以下者机会盲区:小型大语言模型的提示性下行为产生位置偏差而非答案回避
计算与语言
2026-04-29 v1 人工智能
摘要
检测沙盒化——在能力评估中故意低于表现——是AI安全中的一个开放问题。我们测试了临床伪造检测中的症状有效性测试(SVT)逻辑,是否能通过强制选择项目中的低于机会表现(BCB)来识别沙盒化。在规模为7-9 billion参数的指令调优模型中进行预注册的试验中(3个模型,4个MMLU-Pro领域,4个条件,每个细胞500个项目,共24,000个试验),合理性门未能通过。12个模型-域细胞中没有一个显示出显著的低于机会表现。探索性分析揭示了三个在质量上截然不同的失败模式。Qwen-2.5-7B和Phi-3.5-mini主要忽略了沙盒化指令,62-88%的响应与诚实基线相同。Llama-3-8B基本遵从,但以位置启发式方式实施低于表现,将其响应分布压缩到中间字母选项(E在31.8%,F在26.1%), regardless of 正确答案所在位置。这在正确答案恰好占据模型首选位置时,导致准确率提升最高可达33个百分点。明确的反任务指令(‘pick the least likely answer’)驱动了其中两个模型低于机会,准确率最低可达0.024。实现答案感知回避的能力因此存在,但并非通过‘故意低于表现’激活。BCB未能作为答案感知回避的逻辑标记失败。它在本体规模下未被观察到,因为表现最大行为转变的模型表现出符合位置主导响应策略的行为,而非内容感知的答案回避。我们提出,位置分布偏移可能比低于机会准确率更有效地识别此模型规模下的提示性下行为。
引用
@article{arxiv.2604.25249,
title = {Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance},
author = {Jon-Paul Cacioli},
journal= {arXiv preprint arXiv:2604.25249},
year = {2026}
}
备注
10 pages, 2 figures, 2 tables. Pre-registered: https://osf.io/6zftv/