迈向无损可解释性:基于混合解码器的稠密层忠实分解
机器学习
2026-01-15 v3 人工智能
摘要
多层感知机(MLP)是大型语言模型的重要组成部分,然而其稠密表示使得它们难以理解、编辑和引导。近期方法通过神经元级稀疏性学习可解释的近似,但无法忠实地重构原始映射——显著增加了模型的下一词元交叉熵损失。在本文中,我们提倡转向层级稀疏性,以克服稀疏层近似中的精度权衡。在此范式下,我们引入了混合解码器。MxD 推广了 MLP 和门控线性单元,将预训练的稠密层扩展为数以万计的专门化子层。通过一种灵活的张量分解形式,每个稀疏激活的 MxD 子层实现了具有全秩权重的线性变换——即使在重度稀疏下也能保留原始解码器的表达能力。实验表明,在参数量高达 3B 的语言模型中,MxD 在稀疏性-精度边界上显著优于现有最先进方法(例如 Transcoders)。在稀疏探测和特征引导上的进一步评估表明,MxD 学习到了类似专门化的自然语言特征——为设计可解释且忠实的分解开辟了一条充满前景的新途径。我们的代码包含在:https://github.com/james-oldfield/MxD/。
引用
@article{arxiv.2505.21364,
title = {Towards Interpretability Without Sacrifice: Faithful Dense Layer Decomposition with Mixture of Decoders},
author = {James Oldfield and Shawn Im and Sharon Li and Mihalis A. Nicolaou and Ioannis Patras and Grigorios G Chrysos},
journal= {arXiv preprint arXiv:2505.21364},
year = {2026}
}
备注
NeurIPS 2025 camera-ready version