中文

一学生通晓众专家所知:从稀疏到稠密

机器学习 2022-10-26 v4 人工智能 计算与语言 计算机视觉与模式识别

摘要

人类教育体系由多位专家培养一名学生。混合专家(MoE)是一种包含多个专家的强大的稀疏架构。然而,稀疏MoE模型易于过拟合、难以部署,且对从业者而言不友好于硬件。受人类教育模型启发,本文提出一项新任务——知识整合,以获得一个如稀疏MoE一样博识的稠密学生模型(OneS)。我们通过提出一个包含知识收集与知识蒸馏的通用训练框架来研究该任务。具体而言,为从不同预训练专家处收集关键知识,我们首先考察了四种不同的可能知识收集方法,即求和、平均、本文提出的Top-K知识收集(Top-KG)与奇异值分解知识收集(SVD-KG)。随后我们通过知识蒸馏精炼稠密学生模型,以抵消收集带来的噪声。在ImageNet上,我们的OneS保留了来自MoE的61.7%61.7\%收益,并以仅1515M参数在ImageNet上达到78.4%78.4\%的top-1准确率。在四个自然语言处理数据集上,OneS获得了88.2%88.2\%的MoE收益,并在相同架构与训练数据下以51.7%51.7\%的优势超越最佳基线。此外,与MoE对应模型相比,由于更少的计算量与硬件友好架构,OneS可实现3.7×3.7 \times的推理加速。

关键词

引用

@article{arxiv.2201.10890,
  title  = {One Student Knows All Experts Know: From Sparse to Dense},
  author = {Fuzhao Xue and Xiaoxin He and Xiaozhe Ren and Yuxuan Lou and Yang You},
  journal= {arXiv preprint arXiv:2201.10890},
  year   = {2022}
}