框架税:NLP研究与部署中推理效率的差距
机器学习
2023-12-25 v2
摘要
对NLP系统计算效率的日益关注推动了高效模型架构的设计以及底层硬件加速器的改进。然而,由此带来的计算吞吐量提升与浮点运算减少并未直接转化为挂钟推理延迟的改善。我们证明这些差异在很大程度上可归因于深度学习框架引入的瓶颈。我们将此现象称为\textit{框架税}(framework tax),并观察到随着硬件速度随时间提升,这种差距正在扩大。在这项工作中,我们通过一系列案例分析来审视该现象,分析模型设计决策、框架范式和硬件平台对总模型延迟的影响。代码可在 https://github.com/JaredFern/Framework-Tax 获取。
引用
@article{arxiv.2302.06117,
title = {The Framework Tax: Disparities Between Inference Efficiency in NLP Research and Deployment},
author = {Jared Fernandez and Jacob Kahn and Clara Na and Yonatan Bisk and Emma Strubell},
journal= {arXiv preprint arXiv:2302.06117},
year = {2023}
}
备注
EMNLP 2023