中文

超越余弦相似度重新审视大语言模型中的层相关性

机器学习 2026-05-15 v1 计算与语言

摘要

大语言模型(LLM)彻底改变了自然语言处理。理解其内部机制对于开发更具可解释性和优化的架构至关重要。机制可解释性推动了各种评估层相关性方法的发展,其中余弦相似度是该领域广泛使用的工具。在本工作中,我们证明余弦相似度是移除层所导致实际性能下降的一个糟糕代理。我们的理论分析表明,一个层可以表现出任意低的余弦相似度分数,但对模型的性能仍至关重要。另一方面,来自一系列 LLM 的经验证据证实,余弦相似度与实际性能下降之间的相关性通常很弱或中等,从而导致对 Transformer 内部机制的误导性解释。我们提出了一种更鲁棒的评估层相关性的指标:移除某层导致的模型准确率的实际下降。尽管这是一个计算成本高昂的指标,但该方法提供了对层重要性的更准确描绘,从而允许制定更明智的剪枝策略和构建轻量级模型。我们的发现对可解释 LLM 的开发具有重要意义,并强调了在评估层相关性时需要超越余弦相似度。

关键词

引用

@article{arxiv.2605.14075,
  title  = {Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity},
  author = {Cristian Hinostroza and Rodrigo Toro Icarte and Christ Devia and Andres Carvallo De Ferari and Eugenio Herrera-Berg and Denis Parra and Jorge F Silva},
  journal= {arXiv preprint arXiv:2605.14075},
  year   = {2026}
}

备注

Published at ICLR 2026