推理模型中的霍奇森效应:评估与引导测试意识
计算与语言
2025-10-29 v3 计算机与社会
摘要
关注推理的大型语言模型在检测到正在对其进行评估时有时会改变其行为,这可能导致它们针对测试通过性能进行优化,或在现实世界后果看似缺失时更容易遵从有害提示。我们提出了对这种“test awareness”影响模型行为的首次定量研究,特别是其对安全相关任务的影响。我们引入一种白盒探针框架(i)线性识别与意识相关的激活,(ii)在监控下下发模型对 test awareness 的控制。我们将其应用于不同主流的开源推理 LLMs,涵盖真实和假设性任务(指示测试或模拟)。我们的结果表明,test awareness 对安全对齐(包括遵从有害请求和顺从刻板印象)具有显著影响,影响大小和方向在不同模型间各不相同。通过对这种潜在效应提供控制,本工作旨在提供一种压力测试机制并增加我们对安全评估的可信度。
引用
@article{arxiv.2505.14617,
title = {The Hawthorne Effect in Reasoning Models: Evaluating and Steering Test Awareness},
author = {Sahar Abdelnabi and Ahmed Salem},
journal= {arXiv preprint arXiv:2505.14617},
year = {2025}
}
备注
NeurIPS 2025 (Spotlight). Code is available at: https://github.com/microsoft/Test_Awareness_Steering