中文

MCFuser:面向内存绑定计算密集型算子链的高性能快速融合

分布式、并行与集群计算 2025-06-30 v1 编程语言

摘要

算子融合是一种改善数据局部性并缓解 GPU 内存带宽压力的关键技术,但由于计算吞吐已饱和,常常无法将其扩展到多个计算密集型算子的融合。然而,张量维度大小的动态性可能导致这些算子变为内存绑定,此时需要生成融合内核,而这受限于融合策略的搜索空间受限、冗余内存访问以及调优时间延长,导致亚最优性能和低效部署。我们提出MCFuser,这是一个旨�克服上述障碍的 pioneering 框架,用于生成面向内存绑定计算密集型 (MBCI) 算子链的高性能融合内核。通过采用高级分块表达式勾勒完整的搜索空间,结合有向无环图 (DAG) 分析以消除冗余内存访问,MCFuser 简化了内核优化。通过实施准则来修剪搜索空间并纳入具有鲁棒性搜索的分析性性能模型,MCFuser 不仅显著加快调优过程,还展示了卓越的性能。基准测试表明,在 NVIDIA A100 和 RTX3080 GPU 上,MCFuser 相较于 Ansor 等领先编译器实现了最高达 5.9 倍的内核性能提升,同时其他基线方法也全面超越,并将调优时间缩短了 70 倍以上,凸显了其敏捷性。

关键词

引用

@article{arxiv.2506.22169,
  title  = {MCFuser: High-Performance and Rapid Fusion of Memory-Bound Compute-Intensive Operators},
  author = {Zheng Zhang and Donglin Yang and Xiaobo Zhou and Dazhao Cheng},
  journal= {arXiv preprint arXiv:2506.22169},
  year   = {2025}
}

备注

12 pages, accepted at SC 2024