中文

消除交叉编码器中的稀疏性伪影:用于解释聊天微调

机器学习 2026-02-23 v4 人工智能 计算与语言

摘要

模型差分是研究微调如何改变模型表示和内部算法的研究领域。许多感兴趣的行为在微调过程中被引入,模型差分提供了解释此类行为的有前景的视角。交叉编码器是一种最近的模型差分方法,通过学习在基础模型和微调后模型中都表示为潜在方向的可解释概念的共享词典,使我们能够跟踪概念在微调期间的偏移或出现。值得注意的是,先前的工作观察到在基础模型中没有方向的概念,并假设这些模型特定的潜在变量是微调期间引入的概念。然而,我们识别出两个源于交叉编码器L1训练损失的问题,可能将概念错误地归因为仅存在于微调后模型中,实际上它们存在于两个模型中。我们开发了潜在比例(Latent Scaling)以更准确地衡量每个潜在变量在两个模型中的存在情况,以标记这些问题。在对比Gemma 2 2B基础模型和聊天模型的实验中,我们发现标准交叉编码器受到这些问题的严重影响。基于这些见解,我们训练了一个使用BatchTopK损失的交叉编码器,显示它显著缓解了这些问题,发现更多真正聊天特定且高度可解释的概念。我们建议实践者采用类似技术。使用BatchTopK交叉编码器,我们成功识别了一组可解释且具有因果效应的聊天特定潜在变量,代表概念如"虚假信息"和"个人问题",以及多个与拒绝相关的潜在变量,显示对不同拒绝触发器的细微偏好。总体而言,我们的工作推进了基于交叉编码器的方法论最佳实践,并展示了它能够提供关于聊天微调如何修改模型行为的具体见解。

关键词

引用

@article{arxiv.2504.02922,
  title  = {Overcoming Sparsity Artifacts in Crosscoders to Interpret Chat-Tuning},
  author = {Julian Minder and Clément Dumas and Caden Juang and Bilal Chugtai and Neel Nanda},
  journal= {arXiv preprint arXiv:2504.02922},
  year   = {2026}
}

备注

51 pages, 33 figures, Accepted at 39th Conference on Neural Information Processing Systems (NeurIPS 2025)