中文

MAPLE:用于延迟估计的微处理器先验

机器学习 2022-05-26 v2 人工智能

摘要

现代深度神经网络必须在展现低延迟与低能耗的同时具备最先进的精度。因此,神经架构搜索(NAS)算法在生成新架构时会考虑这两个约束。然而,诸如延迟之类的效率指标通常依赖于硬件,要求NAS算法测量或预测架构延迟。测量每个被评估架构的延迟会给NAS过程增加大量时间。本文我们提出用于延迟估计的微处理器先验MAPLE,它不依赖迁移学习或域适应,而是通过在训练时引入先验硬件特征来泛化到新硬件。MAPLE利用一种新颖的定量策略,通过测量相关硬件性能指标来刻画底层微处理器,从而产生细粒度且具表现力的硬件描述符。此外,所提出的MAPLE受益于CPU与GPU之间紧密耦合的I/O及其依赖性,在测量来自喂送GPU硬件的CPU的微处理器性能硬件计数器的同时预测GPU上的DNN延迟。通过该作为硬件描述符的定量策略,MAPLE可通过少样本适应策略泛化到新硬件,仅用少至3个样本便比需要多达10个样本的最先进方法提升6%。实验结果表明,将少样本适应样本增至10个时,相比最先进方法精度显著提升12%。此外,结果表明在任何适应样本数量下,MAPLE平均比相关基线精度高出8-10%。

关键词

引用

@article{arxiv.2111.15106,
  title  = {MAPLE: Microprocessor A Priori for Latency Estimation},
  author = {Saad Abbasi and Alexander Wong and Mohammad Javad Shafiee},
  journal= {arXiv preprint arXiv:2111.15106},
  year   = {2022}
}

备注

13 pages, 4 figures