可扩展的多任务低秩模型适配
摘要
将多任务低秩适配 (LoRA) 扩展到大量任务会导致性能恶化,例如在 DOTA 上从 5 个任务扩展到 15 个任务时准确率下降至 2.0%。这种失败源于参数和表征的错位。我们发现,正则化和动态路由等现有解决方案在大规模下难以实现,因为它们受制于一个根本性权衡:加强正则化以减少任务间冲突,反而不慎抑制了有效路由所必需的特征判别能力。在本工作中,我们识别了这一权衡的两个根本原因。首先,均匀正则化破坏了任务间知识共享:共享的底层知识集中在高奇异值分量上(Flanv2->BBH 上达 89% 对齐)。均匀正则化迫使高奇异值分量以正交方向更新,直接破坏共享知识。其次,冲突放大:在组件级(如 W_q、W_v)应用 LoRA 会放大梯度冲突;我们显示,块级适配通过 76% 减少冲突,仅需 50% 参数。基于这些洞见,我们提出 mtLoRA,一个具有三个新设计的可扩展解决方案:1) 谱感知正则化,以选择性对低奇异值分量进行正交化,同时保留高奇异值共享知识;2) 块级适配以缓解冲突放大并大幅提高参数效率;3) 细粒度路由使用维度特定权重以获得更强的表达能力。在四个大规模(15-25 个任务)视觉(DOTA 和 iNat2018)和 NLP(Dolly-15k 和 BBH)基准上,mtLoRA 在 DOTA、iNat2018、Dolly-15k 和 BBH 上的准确率分别达到 91.7%、81.5%、44.5% 和 38.5%,平均超过最新方法 2.3%,同时使用 47% 更少参数和 24% 更少训练时间。
引用
@article{arxiv.2603.01526,
title = {Scalable Multi-Task Low-Rank Model Adaptation},
author = {Zichen Tian and Antoine Ledent and Qianru Sun},
journal= {arXiv preprint arXiv:2603.01526},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026. 21 pages, 4 figures, 11 tables. Code is available