中文

LLM性能预测器可作为架构搜索的良好初始化器

计算与语言 2024-08-09 v2

摘要

在本工作中,我们利用大语言模型(LLMs)用于一个新颖用例:构建性能预测器(PP),用以估计特定深度神经网络架构在下游任务上的性能。我们为LLM创建PP提示,包含(i)角色描述,(ii)对LLM的指令,(iii)超参数定义,以及(iv)展示带有效率指标与“从头训练”性能的样例架构的演示。在机器翻译(MT)任务中,采用我们PP提示的GPT-4(LLM-PP)相比基线预测器取得了SOTA平均绝对误差,秩相关系数略有下降。此外,我们证明LLM-PP的预测可蒸馏至紧凑回归模型(LLM-Distill-PP),其惊人地保留了LLM-PP的大部分性能。这提供了资源密集型性能估计的一种经济替代方案。具体地,对于神经架构搜索(NAS),我们引入混合搜索算法(HS-NAS),在初始搜索阶段采用LLM-Distill-PP,随后回退至基线预测器。HS-NAS表现与SOTA NAS相近,将搜索时间减少约50%,且在某些情况下改善了延迟、GFLOPs与模型大小。代码见:https://github.com/UBC-NLP/llmas。

关键词

引用

@article{arxiv.2310.16712,
  title  = {LLM Performance Predictors are good initializers for Architecture Search},
  author = {Ganesh Jawahar and Muhammad Abdul-Mageed and Laks V. S. Lakshmanan and Dujian Ding},
  journal= {arXiv preprint arXiv:2310.16712},
  year   = {2024}
}

备注

ACL 2024 Findings