M-Wanda:改进多语言 LLM 的一次性剪枝
计算与语言
2025-05-28 v1 人工智能
摘要
多语言 LLM 的性能通常关键依赖于模型大小。着眼于效率,这引发了人们对一次性剪枝方法的浓厚兴趣,这些方法在缩小模型大小的同时保留了大规模预训练的优势。然而,由于剪枝往往伴随着性能损失,因此理解多语言性与稀疏化之间的权衡非常重要。在这项工作中,我们研究了不同稀疏性约束下的多语言性能,并表明中等稀疏比例已经会严重损害性能。为了帮助弥合这一差距,我们提出了 M-Wanda,这是一种剪枝方法,通过将语言感知激活统计量纳入其剪枝标准来建模跨语言变异,并根据跨语言重要性动态调整逐层稀疏性。我们表明 M-Wanda 以极少的额外成本持续提升性能。我们是首个明确优化剪枝以保留多语言性能的研究,并希望启发未来在多语言剪枝方面的进展。
引用
@article{arxiv.2505.21171,
title = {M-Wanda: Improving One-Shot Pruning for Multilingual LLMs},
author = {Rochelle Choenni and Ivan Titov},
journal= {arXiv preprint arXiv:2505.21171},
year = {2025}
}