Mod-Squad:将混合专家设计为模块化多任务学习器
计算机视觉与模式识别
2022-12-16 v1 人工智能
机器学习
摘要
多任务学习(MTL)中的优化比单任务学习(STL)更具挑战性,因为来自不同任务的梯度可能相互矛盾。当任务相关时,在任务间共享部分参数(协作)是有益的。然而,某些任务需要额外的具备特定数据类型或判别专长的参数(专门化)。为应对 MTL 挑战,我们提出 Mod-Squad,一种被模块化划分为若干专家组(一个“Squad”)的新模型。该结构使我们能够将协作与专门化形式化为专家与任务匹配的过程。我们在单一模型训练期间优化此匹配过程。具体而言,我们将混合专家(MoE)层引入 transformer 模型,并采用一种融合任务与专家间相互依赖关系的新损失。因此,每个任务仅激活一小部分专家。这避免了在所有任务间共享整个骨干模型,从而增强了模型,尤其在训练集规模与任务数量增大时。更有趣的是,对每个任务,我们可提取该小部分专家作为独立模型,其性能与大型模型一致。在含 13 个视觉任务的 Taskonomy 数据集与含 5 个视觉任务的 PASCAL-Context 数据集上的大量实验表明了本方法的优越性。
引用
@article{arxiv.2212.08066,
title = {Mod-Squad: Designing Mixture of Experts As Modular Multi-Task Learners},
author = {Zitian Chen and Yikang Shen and Mingyu Ding and Zhenfang Chen and Hengshuang Zhao and Erik Learned-Miller and Chuang Gan},
journal= {arXiv preprint arXiv:2212.08066},
year = {2022}
}