SuperShaper:具有可变隐藏维度的BERT模型任务无关超级预训练
机器学习
2021-10-12 v1 计算与语言
摘要
任务无关预训练后接任务特定微调是训练NLU模型的默认方法。此类模型需要部署在跨越云端与边缘、具有不同资源与精度约束的设备上。对于给定的任务,在数十台设备上重复预训练与微调成本高得令人望而却步。我们提出SuperShaper,一种任务无关的预训练方法,它通过改变形状(即跨层改变隐藏维度)同时预训练大量Transformer模型。这由一个带线性瓶颈矩阵的骨干网络实现,该矩阵位于每个Transformer层周围,通过切片生成不同形状的子网络。尽管设计空间简单且实现高效,SuperShaper发现的网络有效权衡了精度与模型大小:在GLUE基准上,发现的网络比一系列手工设计和自动搜索的网络更准确。此外,我们发现形状作为神经架构搜索(NAS)设计变量的两个关键优势:(a)可推导良好形状的启发式规则,依此发现的网络在一系列参数量上匹配甚至优于精心搜索的网络;(b)跨多种CPU和GPU的网络延迟对形状不敏感,从而支持设备无关搜索。总之,SuperShaper从根本上简化了语言模型的NAS,并发现了可跨任务、参数约束和设备泛化的网络。
引用
@article{arxiv.2110.04711,
title = {SuperShaper: Task-Agnostic Super Pre-training of BERT Models with Variable Hidden Dimensions},
author = {Vinod Ganesan and Gowtham Ramesh and Pratyush Kumar},
journal= {arXiv preprint arXiv:2110.04711},
year = {2021}
}