FlashSpread:基于核融合的 IO-aware GPU 非马尔可夫传染动力学仿真
分布式、并行与集群计算
2026-05-01 v2
摘要
多模态(更新型)传染病仿真至关重要,用于在一般年龄相关保留时间分布(对数正态、威布尔、Erlang 等)下进行真实预测,但年龄相关风险导致稠密的逐步更新,使标准 CPU 方法的稀疏事件队列策略失效。我们提出 FlashSpread,一种 GPU 框架,将每一步更新管道(CSR 遍历、基于 erfcx 的数值稳定风险评估、伯努利 tau-leaping、状态转换和下一步感染性写回)整合为单个融合 Triton 内核,其中间结果永远留在流式多处理器寄存器中,通过块标量跳过保持 CUDA Graph 捕获,并通过度感知 CSR 分派(线程/ warp/ 边合并)在尺度自由图上保持峰值吞吐。在 NVIDIA A100 上,该融合 CUDA-Graph 引擎在 N=10^6 时达到 8.09 Giga-NUPS(均匀度图),相对于相同 N 上的优化 CPU tau-leaping 快 217 倍;在相同规模的巴拉拉西-阿伯特图上,合并分派相对于默认内核恢复 4.5 倍(0.45 到 2.0 Giga-NUPS),框架可扩展至单张 A100(40 GB)上的 N=10^8,混合精度存储路径将 L2 可达规模延长约 3 倍,在带宽受限末端提升 1.15 倍吞吐。与精确非马尔可夫 Gillespie 参考的验证显示,结构偏差在峰值感染和最终攻击率上分别约为 6% 和 7%,随着 epsilon 接近 0 跨越两个数量级的容差几乎不减,仍在典型流行病学参数不确定性范围内。代码:https://github.com/Shakeri-Lab/FlashSpread。
引用
@article{arxiv.2604.22092,
title = {FlashSpread: IO-Aware GPU Simulation of Non-Markovian Epidemic Dynamics via Kernel Fusion},
author = {Heman Shakeri and Behnaz Moradi-Jamei and Aram Vajdi and Ehsan Ardjmand},
journal= {arXiv preprint arXiv:2604.22092},
year = {2026}
}