推理时的动态网络自适应
机器学习
2022-04-19 v1 性能
摘要
机器学习(ML)推理是一种实时工作负载,必须遵守严格的服务级别目标(SLO),包括延迟和准确率目标。遗憾的是,由于固有的模型准确率-延迟权衡、应用域间及域内的 SLO 多样性、SLO 随时间的演化、不可预测的查询模式以及共置干扰,在推理服务系统中确保不违反 SLO 颇具挑战。本文中,我们观察到神经网络在推理过程中表现出高度的逐输入激活稀疏性。因此,我们提出 SLO 感知神经网络(SLO-Aware Neural Networks),其针对每次推理查询动态丢弃节点,从而根据指定的 SLO 优化目标和机器利用率来调节所执行的计算量。SLO 感知神经网络实现了 的平均加速,且准确率损失极小乃至无损(小于 0.3%)。在准确率受限时,SLO 感知神经网络能够用同一训练好的模型以低延迟服务一系列准确率目标。在延迟受限时,SLO 感知神经网络可主动缓解共置干扰带来的延迟退化,同时保持高准确率以满足延迟约束。
引用
@article{arxiv.2204.08400,
title = {Dynamic Network Adaptation at Inference},
author = {Daniel Mendoza and Caroline Trippel},
journal= {arXiv preprint arXiv:2204.08400},
year = {2022}
}