Decomposing the Basic Abilities of Large Language Models: Mitigating Cross-Task Interference in Multi-Task Instruct-Tuning
计算与语言
2026-05-08 v1 人工智能
摘要
最近,大型语言模型(LLM)的显著性能很大程度上归功于多任务指令调优。然而,这一训练范式存在一个关键问题,即由于不同任务之间对共享参数的冲突梯度导致交叉任务干扰。一些先前的方法通过隔离任务特定参数来缓解此问题,例如任务特定神经元选择和专家混合。在本文中,我们经验性地揭示了现有解决方案仍存在交叉任务干扰,因为许多参数仍由不同任务共享,从而我们提出了一种新方法,即Basic Abilities Decomposition for multi-task Instruct-Tuning(BADIT)。具体而言,我们经验发现,某些参数持续被共同激活,共同激活的参数自然组织为基组。这激励我们类比LLM编码了几个正交的基本能力,而任何任务都可以表示为这些能力的线性组合。因此,我们提出BADIT将LLM参数分解为表示基本能力的正交高奇异值LoRA专家,并通过对秩1分量的球面聚类在训练期间动态强制它们的正交性。在6个LLM上进行的SuperNI基准的广泛实验表明,BADIT能超过SOTA方法,减轻交叉任务干扰的程度。
引用
@article{arxiv.2605.05676,
title = {Decomposing the Basic Abilities of Large Language Models: Mitigating Cross-Task Interference in Multi-Task Instruct-Tuning},
author = {Bing Wang and Ximing Li and Changchun Li and Jinjin Chi and Gang Niu and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2605.05676},
year = {2026}
}
备注
Accepted by ICML 2026. 25 pages, 13 figures. Code: https://github.com/wangbing1416/BADIT