中文

超网混合:以架构路由专家混合改进权重共享超网训练

计算与语言 2024-08-09 v2

摘要

权重共享超网对于前沿神经架构搜索(NAS)框架中的性能估计至关重要。尽管其无需重训练即可生成多样子网络,但由于权重共享,这些子网络的质量无法得到保证。在机器翻译与预训练语言建模等 NLP 任务中,相同模型架构下超网与从头训练之间存在显著的性能差距,需在确定最优架构后重新训练。本研究提出一种称为超网混合(mixture-of-supernets)的解决方案,这是一种利用专家混合(MoE)以增强超网模型表达力且训练开销极小的广义超网形式。与传统超网不同,该方法采用基于架构的路由机制,使子网络间实现模型权重的间接共享。这种针对特定架构并通过梯度下降学习的权重定制,最小化了重训练时间,显著提升了 NLP 中的训练效率。所提方法在快速机器翻译模型 NAS 中达到最先进(SoTA)性能,相较机器翻译 SoTA NAS 框架 HAT 展现出更优的延迟-BLEU 权衡。此外,其在构建内存高效的任务无关 BERT 模型的 NAS 中亦表现优异,在各种模型规模下均超越 NAS-BERT 与 AutoDistil。代码见:https://github.com/UBC-NLP/MoS。

关键词

引用

@article{arxiv.2306.04845,
  title  = {Mixture-of-Supernets: Improving Weight-Sharing Supernet Training with Architecture-Routed Mixture-of-Experts},
  author = {Ganesh Jawahar and Haichuan Yang and Yunyang Xiong and Zechun Liu and Dilin Wang and Fei Sun and Meng Li and Aasish Pappu and Barlas Oguz and Muhammad Abdul-Mageed and Laks V. S. Lakshmanan and Raghuraman Krishnamoorthi and Vikas Chandra},
  journal= {arXiv preprint arXiv:2306.04845},
  year   = {2024}
}

备注

ACL 2024 Findings