拼图:针对异构处理器上的移动设备调度多个深度学习模型
机器学习
2025-08-26 v1 操作系统
摘要
随着深度学习模型在移动设备上的部署日益增长,现代移动设备已集成针对日益增长的计算需求的深度学习专用加速器,从而增加了硬件异构性。然而,现有大多数针对跨这些处理器调度深度学习工作负载的研究都存在显著局限:大多数研究聚焦于单模型场景,而非更贴近现实的多模型场景,忽视了不同硬件/软件配置带来的性能差异,以及难以准确估计执行时间。为此,我们提出一种基于遗传算法的新方法,用于异构处理器上调度多个深度学习网络,通过将网络划分为多个子图。我们的approach 引入了三种不同类型的染色体进行分区/映射/优先级探索,并利用设备内联剖析与评估实现准确的执行时间估计。基于该方法,我们构建的系统Puzzle 在大量随机生成的场景(涉及九个最先进网络)中表现出优异性能。结果表明,Puzzle 在平均情况下分别比两个启发式基准(NPU Only 和 Best Mapping)支持3.7倍和2.2倍的请求频率,同时满足相当水平的实时要求。
引用
@article{arxiv.2508.17764,
title = {Puzzle: Scheduling Multiple Deep Learning Models on Mobile Device with Heterogeneous Processors},
author = {Duseok Kang and Yunseong Lee and Junghoon Kim},
journal= {arXiv preprint arXiv:2508.17764},
year = {2025}
}