中文

为 Gemini 构建生产就绪的探针

机器学习 2026-02-12 v4 人工智能 计算与语言

摘要

前沿语言模型的能力正在迅速提升。因此,我们需要更强的缓解措施,以防止恶意行为者滥用日益强大的系统。先前的工作表明,激活探针可能是一种很有前景的滥用缓解技术,但我们发现了一个仍存在的关键挑战:探针在重要的生产环境分布偏移下无法泛化。具体而言,我们发现从短上下文到长上下文输入的偏移对现有探针架构来说很困难。我们提出了几种新的探针架构来处理这种长上下文分布偏移。我们在网络攻击领域评估了这些探针,测试了它们对各种与生产相关的分布偏移的鲁棒性,包括多轮对话、长上下文提示和自适应红队测试。我们的结果表明,虽然我们的新架构解决了上下文长度问题,但要实现广泛的泛化,需要将架构选择与在多样化分布上的训练相结合。此外,我们表明,由于探针的计算效率高,将探针与提示分类器配对可以以低成本实现最佳准确率。这些发现已促成滥用缓解探针在 Google 的前沿语言模型 Gemini 的面向用户实例中成功部署。最后,我们发现了使用 AlphaEvolve 自动改进探针架构搜索和自适应红队测试的早期积极结果,这表明部分 AI 安全研究的自动化已经实现。

关键词

引用

@article{arxiv.2601.11516,
  title  = {Building Production-Ready Probes For Gemini},
  author = {János Kramár and Joshua Engels and Zheng Wang and Bilal Chughtai and Rohin Shah and Neel Nanda and Arthur Conmy},
  journal= {arXiv preprint arXiv:2601.11516},
  year   = {2026}
}

备注

v4 (another minor acknowledgements fix)