中文

探测与引导语言模型的评估意识

计算与语言 2025-07-10 v2 人工智能

摘要

语言模型能够区分测试与部署阶段——一种称为评估意识的能力。这在安全和政策方面具有重大影响,可能削弱围绕 AI 治理框架和自愿行业承诺的核心评估的可靠性。本文我们研究了 Llama-3.3-70B-Instruct 中的评估意识。我们展示,线性探针可以分离真实世界的评估和部署提示,这表明当前模型内部表示了这一区别。我们还发现,当前的安全评估被探针正确分类,这表明它们对模型而言已经显得人工或不真实。我们的发现强调了确保评估可信的重要性,以及理解欺骗能力的重要性。更广泛地说,我们的工作展示了如何利用模型内部结构来支持黑箱方法进行安全审计,尤其是对于更具评估意识和欺骗能力的未来模型。

关键词

引用

@article{arxiv.2507.01786,
  title  = {Probing and Steering Evaluation Awareness of Language Models},
  author = {Jord Nguyen and Khiem Hoang and Carlo Leonardo Attubato and Felix Hofstätter},
  journal= {arXiv preprint arXiv:2507.01786},
  year   = {2025}
}

备注

Actionable Interpretability Workshop (Poster) and Workshop on Technical AI Governance (Poster) at ICML 2025, Vancouver, Canada