面向 QoS 约束异构多核热优化的 NPU 加速模仿学习
分布式、并行与集群计算
2022-06-14 v1 硬件体系结构
摘要
在用户定义的服务质量(QoS)目标下,应用迁移与动态电压频率调节(DVFS)是充分挖掘异构集群多核处理器热优化潜力的必要手段。然而,为每个应用选择执行核心以及各集群的电压/频率(V/f)等级是一个复杂问题,因为 1)应用的不同特征与 QoS 目标需要不同的优化,且 2)每集群 DVFS 需要考量所有运行应用的全局优化。最先进的功耗或温度最小化资源管理技术要么依赖通常不可得的测量量(如功率),要么未能考虑问题的所有维度(例如使用简化解析模型)。模仿学习(IL)通过从 oracle 策略的演示中训练模型,能够以低运行时开销利用 oracle 策略的最优性。我们首次将 IL 用于 QoS 目标下的温度最小化。我们通过训练神经网络(NN)应对复杂性,并利用神经处理单元(NPU)加速 NN 推理。尽管此类 NN 加速器在终端设备中日益普及,但迄今仅用于加速用户应用。相反,我们在真实平台上使用已有加速器来加速基于 NN 的资源管理。我们在带有 Arm big.LITTLE CPU 与 NPU 的 HiKey 970 板上的评估显示,在可忽略的运行时开销下实现了显著的温度降低,且针对训练时未见过应用及不同散热条件均有效。
引用
@article{arxiv.2206.05459,
title = {NPU-Accelerated Imitation Learning for Thermal Optimization of QoS-Constrained Heterogeneous Multi-Cores},
author = {Martin Rapp and Heba Khdr and Nikita Krohmer and Jörg Henkel},
journal= {arXiv preprint arXiv:2206.05459},
year = {2022}
}