中文

基于张量积的潜在专家混合模型

机器学习 2024-12-09 v2 人工智能

摘要

在多任务学习中,传统方法是同时在多个任务上训练模型。然而,来自不同任务的训练信号可能相互干扰,导致 \textit{negative transfer}。为缓解这一问题,我们研究模块化语言模型是否可以促进正向迁移和系统性泛化。具体而言,我们提出了一种新型模块化语言模型(\texttt{TensorPoly}),在参数效率与细致路由方法之间进行平衡。对于 \textit{modules},我们通过使用张量积运算对 Low-Rank Adaptation(\texttt{LoRA})进行重新参数化,称 resulting approach 为 \texttt{TLoRA}。对于 \textit{routing function},我们根据粒度设计了两种创新的路由函数:\texttt{TensorPoly-I} 针对囊括张量中的每个秩,\texttt{TensorPoly-II} 提供更细粒度的路由方法,针对囊括张量的每个秩。来自多任务 T0-benchmark 的实验结果表明:1) 所有模块化 LM 都超过其对应的稠密方法,凸显了模块化语言模型在缓解多任务学习中的负推断潜力并提供优越结果的潜力。2) \texttt{TensorPoly-I} 在适应性方面实现更高的参数效率,并优于其他模块化 LM,这显示出我们方法在多任务迁移学习中的潜力。

关键词

引用

@article{arxiv.2405.16671,
  title  = {Mixture of Latent Experts Using Tensor Products},
  author = {Zhan Su and Fengran Mo and Prayag Tiwari and Benyou Wang and Jian-Yun Nie and Jakob Grue Simonsen},
  journal= {arXiv preprint arXiv:2405.16671},
  year   = {2024}
}

备注

https://github.com/microsoft/mttl/tree/zs_code