Stream:异构数据流加速器上层融合 DNN 的设计空间探索
硬件体系结构
2025-10-08 v2
摘要
随着深度神经网络的发展,异构数据流加速器以多核架构或基于芯粒设计的形式,通过可扩展性提供了更高的灵活性和推理性能。迄今为止,这些系统通过跨核粗粒度地一次映射单层来利用增加的并行性,这会导致频繁且昂贵的片外内存访问;或者通过对输入批次进行流水线处理,但这无法满足延迟关键型应用的需求。为了缓解这些瓶颈,本研究通过一个名为 Stream 的新型设计空间探索框架,在异构数据流加速器上探索了一种称为层融合 (layer fusion) 的全新细粒度映射范式。Stream 捕获了各种异构数据流架构和映射粒度,并实现了一个经过三种不同的最先进硬件实现验证的、具备内存与通信感知的延迟和能量分析。因此,它通过基于约束优化的策略性工作负载分配,促进了对架构和映射的整体探索。结果表明,将层融合与异构数据流加速器相结合,可使推理效率的能耗延迟积降低高达 2.2 倍,同时解决了能耗和延迟问题。该框架已在以下地址开源:https://github.com/kuleuven-micas/stream。
引用
@article{arxiv.2212.10612,
title = {Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators},
author = {Arne Symons and Linyan Mei and Steven Colleman and Pouya Houshmand and Sebastian Karl and Marian Verhelst},
journal= {arXiv preprint arXiv:2212.10612},
year = {2025}
}
备注
12 pages + references, 16 figures