MechELK:用于激发大语言模型中潜在知识的机制解释框架
计算与语言
2026-05-29 v1
摘要
大语言模型(LLMs)经常在内部表示中编码了factual 和推理知识,而这些知识在表面级输出中并未得到忠实反映——这被称为潜在知识(latent knowledge)。现有的激发潜在知识方法,如对比一致性搜索(CCS),依赖对比激活模式,在处理复杂的多步骤推理任务时效果不佳;而机制解释工具主要用于理解模型行为,而非提取隐藏知识。我们提出了 **MechELK**,一个统一的三阶段框架,将机制解释与潜在知识激发相结合。MechELK 通过以下方式运作:(1)**定位**——使用稀疍自编码器(SAE)特征分析和激活修补以识别知识承载表示;(2)**验证**——采用因果探测来区分真正的潜在知识与伪相关;(3)**激发**——应用表示工程在不修改模型权重的情况下表现隐藏知识。在 TruthfulQA、精选的欺骗对齐基准和 Quirky LM 数据集上评估,MechELK 实现了 84.7% 的平均激发准确率,较 CCS 提升 6.2%,直接线性探测提升 9.1%。关键的是,MechELK 在模型表面输出错误或回避时发现 78.3% 的潜在知识,展示了其在 AI 安全应用中识别欺骗对齐的实用性。
引用
@article{arxiv.2605.28825,
title = {MechELK: A Mechanistic Interpretability Framework for Eliciting Latent Knowledge in Large Language Models},
author = {Ji-jun Park and Soo-joon Choi and Jiwon Jeong and Taeyang Yoon and Ju-Wan Lee},
journal= {arXiv preprint arXiv:2605.28825},
year = {2026}
}