面向 RNN 与 Transformer 的无训练神经架构搜索
机器学习
2023-06-02 v1 人工智能
计算与语言
摘要
神经架构搜索(NAS)使得神经网络架构能够自动创建,为手动设计复杂架构这一费力过程提供了替代方案。然而,传统 NAS 算法速度慢且需要大量计算资源。近期研究探讨了针对图像分类架构的无训练 NAS 度量,极大加速了搜索算法。在本文中,我们研究针对循环神经网络(RNN)和基于 BERT 的 transformer 架构的无训练 NAS 度量,面向语言建模任务。首先,我们提出了一种称为隐藏协方差的新无训练度量,可预测 RNN 架构的训练后性能,并显著优于现有无训练度量。我们在 NAS-Bench-NLP 基准上实验评估了隐藏协方差度量的有效性。其次,我们发现当前 transformer 架构的搜索空间范式并未针对无训练神经架构搜索进行优化。相反,简单的定性分析即可将搜索空间有效收缩至性能最佳的架构。该结论基于我们对现有无训练度量以及从近期 transformer 剪枝文献中开发的新度量的研究,并在我们自建的已训练 BERT 架构基准上进行了评估。最终,我们的分析表明,架构搜索空间与无训练度量必须协同开发才能取得有效结果。
引用
@article{arxiv.2306.00288,
title = {Training-free Neural Architecture Search for RNNs and Transformers},
author = {Aaron Serianni and Jugal Kalita},
journal= {arXiv preprint arXiv:2306.00288},
year = {2023}
}
备注
Code is available at https://github.com/aaronserianni/training-free-nas