中文

SpeedLimit:面向量化Transformer模型的神经架构搜索

机器学习 2023-10-16 v3

摘要

尽管Transformer模型领域的研究主要聚焦于提升准确率与困惑度等性能指标,工业中的实际应用往往需要对推理延迟约束进行严格考量。为应对此挑战,我们引入SpeedLimit,一种新颖的神经架构搜索(NAS)技术,其在遵循延迟上限约束的同时优化准确率。我们的方法在搜索过程中引入8位整数量化,从而优于当前最先进的技术。我们的结果凸显了在性能与延迟间寻求最优平衡的可行性与有效性,为在延迟敏感环境中部署最先进的Transformer模型提供了新途径。

关键词

引用

@article{arxiv.2209.12127,
  title  = {SpeedLimit: Neural Architecture Search for Quantized Transformer Models},
  author = {Yuji Chai and Luke Bailey and Yunho Jin and Matthew Karle and Glenn G. Ko and David Brooks and Gu-Yeon Wei and H. T. Kung},
  journal= {arXiv preprint arXiv:2209.12127},
  year   = {2023}
}