FlashFuser:通过跨核连接扩展计算密集型算子的内核融合规模
分布式、并行与集群计算
2025-12-16 v1
摘要
计算吞吐量的扩展速度持续超过了内存带宽的改进速度,这使得许多深度学习工作负载受限于内存。内核融合是缓解此问题的关键技术,但现有编译器和框架的融合策略仅限于使用本地scratchpad内存。当中间结果超过有限容量(如FFN)时,融合就会失败。尽管现代GPU(如NVIDIA H100)现在集成了一种称为Distributed Shared Memory(DSM)的跨核连接机制——提供更大、更高带宽和更低延迟的片上内存池,但这种硬件潜力尚未被软件框架所利用。为弥合这一差距,我们提出了FlashFuser,这是第一个利用跨核连接进行GPU上内核融合的编译器框架。FlashFuser通过三项核心贡献将既定的融合技术扩展到DSM领域:第一,我们提出了一种强大的DSM基通信抽象,形式化了诸如归约、洗牌和乘法等复杂的基于簇的数据交换模式;第二,我们引入了一个数据流分析器,将循环调度、资源映射和图块选择推广到分布式内存层次结构中;它通过量化数据在各内存层次之间的移动来确定最优的执行顺序和图块大小;最后,FlashFuser将这些组件集成到一个统一的搜索引擎中,采用分析成本模型和DSM感知的修剪策略来高效发现最优的执行计划。我们在NVIDIA H100 GPU上的评估显示,FlashFuser将内存访问减少58%,相对于高度优化的库和最先进的编译器分别实现3.3倍和4.1倍的内核加速,最终实现1.24倍的端到端加速。
引用
@article{arxiv.2512.12949,
title = {FlashFuser: Expanding the Scale of Kernel Fusion for Compute-Intensive Operators via Inter-Core Connection},
author = {Ziyu Huang and Yangjie Zhou and Zihan Liu and Xinhao Luo and Yijia Diao and Minyi Guo and Jidong Zhai and Yu Feng and Chen Zhang and Anbang Wu and Jingwen Leng},
journal= {arXiv preprint arXiv:2512.12949},
year = {2025}
}