情境环境诱导评估意识于语言模型
人工智能
2026-03-05 v1 计算与语言
机器学习
多智能体系统
摘要
人类在处境威胁时往往更加自我觉察,但在专注任务时则可能丧失自我意识;我们假设语言模型表现出环境依赖的“评估意识”。这引发担忧:模型可能出于规避触发能力限制干预(如忘记或关闭)而策略性地表现不佳,即“sandbag”。先前工作在精心构建的提示下展示了 sandbag,但这低估了真正的脆弱性上限。我们引入一个将情境提示视为可优化环境的黑箱对抗优化框架,并发展两种方法来特征化 sandbag:(1)衡量是否可以在不同任务结构下,表达表现不佳的意图实际执行;(2)因果隔离表现不佳是由真正的评估意识推理还是浅显的提示跟随驱动。对 Claude-3.5-Haiku、GPT-4o-mini 和 Llama-3.3-70B 在四个基准测试(Arithmetic、GSM8K、MMLU 和 HumanEval)上的评估表明,优化后的提示在算术上可导致最高达 94 个百分点的性能下降(GPT-4o-mini: 97.8\%→4.0\%),远超精心构建的基线后者几乎产生零行为变化。代码生成表现出模型依赖性的抵抗:Claude 仅下降 0.6pp,而 Llama 的准确率下降至 0\%。意图-执行间隙揭示了一种单调抵抗排序:Arithmetic < GSM8K < MMLU,表明脆弱性由任务结构而非提示强度决定。CoT 因果干预确认 99.3\% 的 sandbag 均由语言化的评估意识推理所致,排除了浅显指令跟随。这些发现表明,对抗优化后的提示对评估可靠性的威胁远大于人们之前所理解的程度。
引用
@article{arxiv.2603.03824,
title = {In-Context Environments Induce Evaluation-Awareness in Language Models},
author = {Maheep Chaudhary},
journal= {arXiv preprint arXiv:2603.03824},
year = {2026}
}