学习在专业化专家间进行路由以实现零样本泛化
机器学习
2024-06-24 v2
摘要
最近,通过参数高效微调专门针对特定任务或领域的“专家”语言模型大量涌现。我们如何回收大量专家语言模型集合,以提升对未见任务的零样本泛化能力?在这项工作中,我们提出了 Post-Hoc Adaptive Tokenwise Gating Over an Ocean of Specialized Experts (PHATGOOSE),该方法学习在通过参数高效微调产生的专业化模块之间进行路由。与以往学习在专业化模型间进行路由的方法不同,PHATGOOSE 探索了这样一种可能性:如果能为模型中的每个 token 和每一层自适应地选择不同的专家,零样本泛化能力将得到提升。关键的是,我们的方法是事后的——它不需要同时访问用于创建专业化模型的数据集,并且在每个专家模型训练完成后仅需适度的额外计算量。在涵盖一系列专业化模型集合和零样本泛化基准的实验中,我们发现 PHATGOOSE 优于以往的事后路由方法,并且在某些情况下优于显式多任务训练(后者需要同时访问数据)。为了更好地理解 PHATGOOSE 学习到的路由策略,我们进行了定性实验,验证了 PHATGOOSE 的性能源于其能够做出自适应的逐 token 和逐模块专家选择。我们发布了所有代码,以支持未来通过回收专业化专家来提升零样本泛化的研究。
引用
@article{arxiv.2402.05859,
title = {Learning to Route Among Specialized Experts for Zero-Shot Generalization},
author = {Mohammed Muqeeth and Haokun Liu and Yufan Liu and Colin Raffel},
journal= {arXiv preprint arXiv:2402.05859},
year = {2024}
}