MoRFI:单调稀疏自编码器特征识别
计算与语言
2026-04-30 v1 机器学习
摘要
大型语言模型(LLMs)在预训练阶段通过下一词预测获得大部分事实知识,而随后的微调阶段常引入超出参数化知识范围的新事实,导致幻觉现象。虽然已证明对新知识进行监督式微调会加剧此问题,但其背后机制仍鲜有了解。我们进行了受控的微调实验,聚焦闭包问答任务,发现可因果贡献于幻觉的潜在方向。具体而言,我们对 Llama 3.1 8B、Gemma 2 9B 和 Mistral 7B v03 进行微调,使用七个不同的单问答数据集,控制新知识的比例和训练周期数。通过在测试集上衡量性能,我们验证了逐步引入新知识会增加幻觉现象,训练时间越长,这一效应越显著。我们利用预训练稀疏自编码器(SAEs)分析各模型在不同检查点上的残差流激活,并提出单调关系特征识别(MoRFI)用于捕捉因果相关的潜在特征。MoRFI 通过筛选对受控微调数据混合物中目标属性作出单调响应的 SAE 特征来实现这一目标。我们的发现表明,接触未知事实会破坏模型在残差流中若干方向上检索存储知识的能力。我们的管道在不同模型之间可靠地发现这些特征,并通过单一潜在干预实现知识恢复。
引用
@article{arxiv.2604.26866,
title = {MoRFI: Monotonic Sparse Autoencoder Feature Identification},
author = {Dimitris Dimakopoulos and Shay B. Cohen and Ioannis Konstas},
journal= {arXiv preprint arXiv:2604.26866},
year = {2026}
}