使用命题探针监控语言模型中的潜在世界状态
计算与语言
2024-12-10 v2 机器学习
摘要
语言模型容易受到偏见、迎合、后门等倾向的影响,这些倾向会导致对输入上下文的响应不够忠实。解释语言模型内部状态有助于监控和纠正不够忠实的行为。我们假设语言模型在潜在的世界模型中表示其输入上下文,并寻求从激活中提取此潜在世界状态。我们通过“命题探针”来实现这一点,这些探针对标记进行组合性探针,以查找词汇信息,并将其绑定到表示世界状态的逻辑命题中。例如,给定输入上下文“Greg 是一位护士。Laura 是一位物理学家。”,我们从模型的激活中解码命题“WorksAs(Greg, nurse)”和“WorksAs(Laura, physicist)”。关键在于识别一个“绑定子空间”,在该子空间中,绑定标记具有高相似性(“Greg”和“nurse”),但未绑定的标记之间不具有高相似性(“Greg”和“physicist”)。我们在有限数量的谓词和属性的封闭世界设置中验证了命题探针。尽管基于简单模板化上下文训练的命题探针仍能推广到重写为短篇故事并翻译成西班牙语的上下文。此外,我们发现在三个情况下,语言模型对输入上下文作出不够忠实的响应——提示注入、后门攻击和性别偏见——解码的命题仍然忠实。这表明语言模型通常编码了一个忠实的世界模型,但解码时可能不够忠实,这激励着寻找更好的可解释性工具来监控语言模型。
引用
@article{arxiv.2406.19501,
title = {Monitoring Latent World States in Language Models with Propositional Probes},
author = {Jiahai Feng and Stuart Russell and Jacob Steinhardt},
journal= {arXiv preprint arXiv:2406.19501},
year = {2024}
}