中文

在 GPU 加速的 FDTD 仿真中克服内存带宽限制的脉动更新方案

光学 2025-03-03 v1

摘要

人工智能的指数级增长推动了高带宽光子互连架构的发展,使其成为现代 AI 超级计算机的关键组件。随着对 AI 计算和连接性不断增长的需求持续上升,用于加速甚至彻底革新光子设计与验证工作流的高吞吐量光子仿真引擎,将成为集成光子学行业日益不可或缺的能力。遗憾的是,光子仿真算法的主力——时域有限差分 (FDTD) 法,由于是一种内存密集但计算轻量的算法,与现代配备用于处理计算密集型工作负载的计算平台存在根本上的不匹配。本文引入了一种用于 FDTD 方法的脉动更新方案,通过减少对全局同步的需求,并将访问全局内存的需求仅限于相邻子域间的边界值情况,从而规避了这种不匹配。我们展示了将该方案应用于完整三维 FDTD 算法的实际实现,在单个 Nvidia H100 GPU 上实现了约每秒 0.15 万亿次单元更新 (TCUPS) 的性能。我们的工作为继续赋能 AI 时代所需的日益高效、高性价比且高吞吐量的光子仿真引擎铺平了道路。

关键词

引用

@article{arxiv.2502.20610,
  title  = {A systolic update scheme to overcome memory bandwidth limitations in GPU-accelerated FDTD simulations},
  author = {Jesse Lu and David Qu and Jim Qu and Ryan Fong and Geun Ho Ahn and Jelena Vuckovic},
  journal= {arXiv preprint arXiv:2502.20610},
  year   = {2025}
}