中文

Apple 统一内存 GPU 上反应堆蒙特卡罗中子输运的粒子排序性能研究

硬件体系结构 2024-03-19 v2

摘要

在 GPU 上使用蒙特卡罗中子输运方法进行核反应堆物理模拟时,粒子的排序对计算性能起着重要作用。传统上,CPU 和 GPU 是以低数据传输速率和高数据传输延迟连接的独立设备。新兴的计算芯片倾向于集成 CPU 和 GPU。Apple 统一内存芯片就是一个例子。此类统一内存芯片为蒙特卡罗中子输运中 CPU 和 GPU 之间的协作新策略打开了大门。在 CPU 上进行粒子排序并在 GPU 上进行输运就是这种新策略的一个例子,而在 CPU 和 GPU 分离的传统设备上,这种策略一直受到高 CPU-GPU 数据传输延迟的困扰。研究结果表明,对于 Apple M2 max 芯片,在 ExaSMR 整堆基准问题和 HTR-10 高温气冷堆燃料球问题上,在 CPU 上排序比在 GPU 上排序具有更好的能效比。部分排序的粒子顺序被认为是 CPU 排序比 GPU 排序性能更高的原因。对于带有乏燃料的 ExaSMR 整堆基准,使用 CPU 和 GPU 的内部代码实现了 CPU 上 OpenMC 7.5 倍的能效;对于带有乏燃料的 HTR-10 燃料球基准,则实现了 150 倍的能效。

关键词

引用

@article{arxiv.2401.11455,
  title  = {Study on the Particle Sorting Performance for Reactor Monte Carlo Neutron Transport on Apple Unified Memory GPUs},
  author = {Changyuan Liu},
  journal= {arXiv preprint arXiv:2401.11455},
  year   = {2024}
}