EcoSpa:基于耦合稀疏性的高效 Transformer 训练方法
机器学习
2025-11-18 v1 人工智能
性能
摘要
Transformer 已成为现代人工智能的基石,但其高计算需求构成了关键系统挑战。虽然稀疏训练可提高效率,但现有方法未能保留那些在注意力和前馈层中进行乘法相互作用的权重矩阵之间的关键结构关系。这种疏漏导致在高稀疏度水平下出现性能下降。我们引入 EcoSpa,这是一种高效的结构化稀疏训练方法,通过对齐行/列删除来联合评估和稀疏化耦合权重矩阵对,保留其相互作用模式。EcoSpa 引入了一种用于校准结构组件重要性的新颖粒度,并在预训练和微调场景中执行耦合估计和稀疏化。评估结果显示,显著的改进:EcoSpa 实现了 LLaMA-1B 训练时 50% 的内存减少和 21% 的加速,实现 GPT-2-Medium 上的 模型压缩,降低困惑度 2.4,提供 的推理加速。该方法使用标准的 PyTorch 操作,无需自定义硬件或内核,使在常规硬件上进行高效 Transformer 训练变得可及。
关键词
引用
@article{arxiv.2511.11641,
title = {EcoSpa: Efficient Transformer Training with Coupled Sparsity},
author = {Jinqi Xiao and Cheng Luo and Lingyi Huang and Cheng Yang and Yang Sui and Huy Phan and Xiao Zang and Yibiao Ying and Zhexiang Tang and Anima Anandkumar and Bo Yuan},
journal= {arXiv preprint arXiv:2511.11641},
year = {2025}
}