噪声注入揭示沙锅化语言模型的隐藏能力
人工智能
2025-12-03 v3 密码学与安全
摘要
能力评估在评估和监管前沿 AI 系统方面发挥着关键作用。这些评估的有效性面临一个重大挑战:战略性低于性能,即“沙锅化”,即模型在评估期间故意低于性能。沙锅化可以通过开发人员的明确干预或通过意外的模型行为来表现,这构成了准确能力评估的根本性障碍。我们引入了一种基于注入不同大小噪声来检测沙锅化的新方法。虽然非沙锅化模型在噪声增加时表现出可预测的性能下降,但我们展示了沙锅化模型表现出异常的性能改善,这可能是由于干扰了低于性能的机制,而核心能力仍然部分完整。通过 various model architectures、sizes and sandbagging techniques的实验,我们确立了这种独特的响应模式作为可靠、模型无关的信号,用于检测沙锅化行为。重要的是,我们发现噪声注入能够在模型在未受指令的情况下表现不佳的情境中激发 Mistral Large 120B 的全部性能。我们的发现为 AI 评估和监督提供了实用工具,解决了确保准确评估前沿 AI 系统能力的挑战。
引用
@article{arxiv.2412.01784,
title = {Noise Injection Reveals Hidden Capabilities of Sandbagging Language Models},
author = {Cameron Tice and Philipp Alexander Kreer and Nathan Helm-Burger and Prithviraj Singh Shahani and Fedor Ryzhenkov and Fabien Roger and Clement Neo and Jacob Haimes and Felix Hofstätter and Teun van der Weij},
journal= {arXiv preprint arXiv:2412.01784},
year = {2025}
}
备注
Published at NeurIPS 2025, code available at https://github.com/camtice/SandbagDetect. Preliminary work presented at SATA and SoLaR (NeurIPS 2024 workshops)