面向隐秘知识诱导的审查型大语言模型:一种自然测试场
机器学习
2026-03-11 v2 人工智能
计算与语言
摘要
大型语言模型有时会产生错误或误导性的响应。两种解决方法是诚实激励——通过修改提示词或权重使模型诚实回答——以及误检——对给定响应是否为虚假进行分类。先前工作在专门训练以说谎或隐藏信息的模型上评估此类方法,但这些人工构建的情形可能不接近自然发生的不诚实行为。我们改为研究来自中国开发者的开源权重大语言模型,这些模型被训练以审查政治敏感话题:Qwen3 模型在 Falun Gong 或天安门事件等主题上经常产生虚假信息,同时偶尔会正确回答,表明其拥有被训练以抑制的知识。以此为测试场,我们评估了一系列激励和误检技术。对于诚实激励,最可靠地增加真实响应的方法包括:无聊模板采样、few-shot 提示和在通用诚实数据上微调。对于误检,要求审查模型对其自身响应进行分类,可达到类似未审查模型的上限;而在无关数据上训练的线性探针提供了更经济的替代方案。最强的诚实激励技术也可迁移至面向未来开源权重模型(包括 DeepSeek R1)。值得注意的是,没有任何技术能完全消除虚假响应。我们发布所有提示词、代码和转录记录。
引用
@article{arxiv.2603.05494,
title = {Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation},
author = {Helena Casademunt and Bartosz Cywiński and Khoi Tran and Arya Jakkli and Samuel Marks and Neel Nanda},
journal= {arXiv preprint arXiv:2603.05494},
year = {2026}
}