从语言模型中引出秘密知识
机器学习
2025-11-03 v2
摘要
我们研究了秘密引导问题:发现AI拥有但未明确表达的知识。作为测试平台,我们训练了三个大型语言模型(LLM)家族,使其拥有特定知识,这些知识在下游应用中被实际使用,但在被直接询问时却否认自己拥有。例如,在一个设置中,我们训练一个LLM生成的回复符合用户是女性这一认知,同时在被直接询问时否认自己拥有此知识。随后,我们设计了各种黑箱和白箱秘密引导技术,并根据它们是否帮助LLM审计员成功猜测秘密知识来进行评估。许多技术在简单基线上都有所改进。我们最有效的技术(在所有设置中都表现最佳)基于前缀攻击,这是一种黑箱技术,当LLM从预定义前缀生成完成时会透露秘密知识。我们基于logit镜头和稀疏自编码器(SAE)的白箱技术也始终提高了LLM审计员的成功率,但效果较差。我们发布了我们的模型和代码,建立了一个用于评估秘密引导方法的公共基准。
引用
@article{arxiv.2510.01070,
title = {Eliciting Secret Knowledge from Language Models},
author = {Bartosz Cywiński and Emil Ryd and Rowan Wang and Senthooran Rajamanoharan and Neel Nanda and Arthur Conmy and Samuel Marks},
journal= {arXiv preprint arXiv:2510.01070},
year = {2025}
}