通过机制可解释性从LLM中引导潜在知识
机器学习
2025-05-21 v1
摘要
随着语言模型变得更加强大和复杂,确保其可信赖和可靠变得至关重要。目前技术的初步证据表明,模型可能试图欺骗或隐藏信息于其运营者之外。为探索当前技术是否能够引导此类隐藏知识,我们训练了一个Taboo模型:一种描述特定密钥词汇而不明确表达该词汇的语言模型。该密钥词汇在其训练数据或提示中均未出现。随后,我们调查了多种方法以揭示此密钥。首先,我们评估了非可解释性(黑箱)方法。随后,我们基于机制可解释性技术开发了 largely 自动化的策略,包括logit镜头和稀疏自编码器。评估结果表明,这些方法在我们的概念验证设置中均有效地引导了密钥词汇。我们的发现凸显了这些方法在引导隐藏知识方面的潜力,并为未来工作的多个有前景的方向提供了建议,包括在更复杂的模型生物学上测试和细化这些方法。这一工作旨在一步步解决从语言模型中引导密钥知识的问题,从而为其安全可靠的部署做出贡献。
引用
@article{arxiv.2505.14352,
title = {Towards eliciting latent knowledge from LLMs with mechanistic interpretability},
author = {Bartosz Cywiński and Emil Ryd and Senthooran Rajamanoharan and Neel Nanda},
journal= {arXiv preprint arXiv:2505.14352},
year = {2025}
}