指令复杂性诱导对抗性 LLM 评估中的位置塌陷
计算与语言
2026-05-01 v1 人工智能
摘要
当被指示在多选评估中表现不佳时,语言模型是与问题内容互动还是回归位置捷径?我们通过对两种指令调优 LLM (Llama-3-8B 和 Llama-3.1-8B)在2000个 MMLU-Pro 项目上施加六个条件的对抗指令特异性梯度来绘制这些方案之间的边界。分布屏蔽(响应位置熵)和独立内容互动准则(难度-准确率相关性)共同描述每个条件。该梯度揭示了三个方案而非单调过渡。模糊的对抗指令导致准确率适度下降且保留内容互动。标准的作弊和能力模仿指令导致位置熵塌陷且内容互动部分保留。一种两步答案感知避免指令导致极端位置塌陷,几乎全部集中在单个响应位置(分别为99.9% 和87.4%),且无可测量的内容敏感性。这唯一一个经过测试的多步骤指令,并且产生了最极端的捷径。吸引位置匹配每个模型在内容缺失的空白提示下的默认值。该效应在两种模型和四个学术领域中均得到复制。分布塌陷和内容互动可以共存(50%的筛查准则之间的一致性),表明熵基筛查和基于难度的内容评估捕获的是响应有效性的部分独立维度。结果表明,指令复杂性可决定小型指令调优 LLM 在贪心解码下是否使用内容感知或内容不敏感机制进行对抗性合规。
引用
@article{arxiv.2604.27249,
title = {Instruction Complexity Induces Positional Collapse in Adversarial LLM Evaluation},
author = {Jon-Paul Cacioli},
journal= {arXiv preprint arXiv:2604.27249},
year = {2026}
}
备注
12 pages, 3 figures, 3 tables. Pre-registered on OSF (osf.io/7p64)