中文

STAR:谱截断与缩放用于模型合并

计算与语言 2025-02-17 v1 人工智能 机器学习

摘要

模型合并是获取多任务模型的有效方法,无需额外微调,已在自然语言处理(NLP)等多个领域获得关注。尽管存在效率优势,但模型合并面临一个显而易见的挑战:随模型数量增加,任务性能不可避免地下降。本文提出了 S\mathbf{S}pectral T\mathbf{T}runcation A\mathbf{A}nd R\mathbf{R}escale(STAR),旨在通过截断谱空间中较小的成分来缓解“合并冲突”,随后采用自动参数缩放方案以保留原始矩阵的核范数。STAR无需在原始训练数据上进行额外推理,对超参数选择具有鲁棍性。我们通过在多样化NLP任务上的大规模模型合并实验展示了STAR的有效性。具体而言,STAR在不同模型规模下均表现稳健,可在Flan-T5上合并12个模型时超过基线方法4.2%。我们的代码已公开于 https://github.com/IBM/STAR。

关键词

引用

@article{arxiv.2502.10339,
  title  = {STAR: Spectral Truncation and Rescale for Model Merging},
  author = {Yu-Ang Lee and Ching-Yun Ko and Tejaswini Pedapati and I-Hsin Chung and Mi-Yen Yeh and Pin-Yu Chen},
  journal= {arXiv preprint arXiv:2502.10339},
  year   = {2025}
}

备注

Accepted to NAACL 2025