中文

面向多语言推理的多语言大语言模型剪枝

计算与语言 2024-10-03 v2

摘要

多语言大语言模型(MLLMs)在多语言平衡数据上训练,相较于在英语主导数据上训练的大语言模型,在非英语语言中展现出更好的零样本学习性能。然而,英语与非英语语言之间的性能差异仍是一个尚未完全解决的挑战。MLLMs 的一个显著特征是其高质量的翻译能力,表明其已获得在语言之间对齐的能力。本研究探讨如何通过利用 MLLMs 在英语与非英语语言之间的对齐能力,来增强其在非英语语言中的零样本性能。为此,我们首先分析了 MLLMs 在执行翻译时的行为,发现存在对翻译过程起关键作用的大幅度特征。受这些发现的启发,我们保留了涉及大幅度特征的操作相关联的权重,并剪枝其他权重,以迫使 MLLMs 在翻译以外的任务中依赖这些特征。我们通过实验证明,这种剪枝策略可以提升 MLLMs 在非英语语言中的性能。

关键词

引用

@article{arxiv.2409.16911,
  title  = {Pruning Multilingual Large Language Models for Multilingual Inference},
  author = {Hwichan Kim and Jun Suzuki and Tosho Hirasawa and Mamoru Komachi},
  journal= {arXiv preprint arXiv:2409.16911},
  year   = {2024}
}

备注

Accepted at EMNLP 2024 Findings