DOTResize: 基于离散最优传输的神经元合并降低大语言模型宽度
机器学习
2026-02-26 v2 计算与语言
摘要
为大语言模型(LLM)设计的结构化剪枝方法通常专注于识别并移除最不重要的组件以优化模型大小。然而,在这项工作中,我们质疑这种普遍方法,转而探索如何将来自被指定剪枝的结构的信息重新组合回缩减后的模型中。我们特别关注神经元宽度缩减,并将此问题建模为一个离散最优传输问题,提出了 DOTResize,一种新颖的 Transformer 压缩方法,它利用最优传输理论来变换和压缩模型宽度。为确保在 Transformer 架构中的适用性,我们激励并引入了必要的熵正则化和矩阵分解技术到由我们的方法产生的传输映射中。与基于重要性度量丢弃神经元的剪枝方法不同,DOTResize 重新投影整个神经元宽度,允许在缩减后的层中保留和重新分配有用信号。实验结果表明,与简单或最先进的神经元宽度剪枝技术相比,DOTResize 作为剪枝的有用补充,同时在现实计算成本方面实现了可衡量的降低。
引用
@article{arxiv.2507.04517,
title = {DOTResize: Reducing LLM Width via Discrete Optimal Transport-based Neuron Merging},
author = {Neha Verma and Kenton Murray and Kevin Duh},
journal= {arXiv preprint arXiv:2507.04517},
year = {2026}
}