中文

Wasserstein距离、神经元纠缠与稀疏性

机器学习 2025-02-27 v4 人工智能

摘要

解开多语义神经元是当前许多大型语言模型可解释性方法的核心。本文尝试研究如何利用解缠来理解性能,特别是在权重稀疏性(一种领先的训练后优化技术)下。我们提出了一种新的衡量神经元纠缠程度的度量:神经元输出分布与高斯分布的Wasserstein距离。此外,我们展示了在LLM的每个线性层中存在少量高度纠缠的“Wasserstein神经元”,其特征是高度非高斯输出分布、将相似输入映射到不相似输出的作用,以及对模型准确性的显著影响。为了研究这些现象,我们提出了一个新的实验框架来解开多语义神经元。我们的框架将每层的输入分离,创建一个专家混合模型,其中每个神经元的输出由多个较低Wasserstein距离的神经元的混合计算,每个神经元在未经重新训练的情况下进行稀疏化时能更好地保持准确性。我们提供了强有力的证据,表明这是因为稀疏专家混合有效地解开了单个神经元的输入-输出关系,特别是困难的Wasserstein神经元。

关键词

引用

@article{arxiv.2405.15756,
  title  = {Wasserstein Distances, Neuronal Entanglement, and Sparsity},
  author = {Shashata Sawmya and Linghao Kong and Ilia Markov and Dan Alistarh and Nir Shavit},
  journal= {arXiv preprint arXiv:2405.15756},
  year   = {2025}
}

备注

10 pages, 9 figures