中文

数据冗余对 MLFMA 近场计算加速效果的建模

分布式、并行与集群计算 2025-11-27 v1 性能

摘要

多层快速多极阵列算法(MLFMA)中的近场(P2P)算子在 GPU 上因内存局部性差成为性能瓶颈。本文通过减少内存访问散布性引入数据冗余以提升空间局部性。为验证结果,本文提出基于局部性指标的分析模型,将数据体积与访问散布性相结合,以预测加速趋势,无需依赖硬件特定的剖析。该方法在两个基于 MLFMA 的应用中得到验证:一个结构规则的电磁求解器(DBIM-MLFMA),以及分布不规则的星体动力学代码(PhotoNs-2.0)。结果显示,由于缓存行为改善,内核加速最高可达 7 倍。然而,数据体积增加导致数据重构开销上升,限制端到端应用加速仅为 1.04 倍。虽然该模型无法精确预测绝对加速值,但可可靠地捕捉不同问题规模与密度下的性能趋势。该技术可通过最小代码修改注入现有实现。本工作表明,在数据移动成本低于局部性收益时,数据冗余可增强 P2P 算子的 GPU 性能。

关键词

引用

@article{arxiv.2511.21535,
  title  = {Modeling the Effect of Data Redundancy on Speedup in MLFMA Near-Field Computation},
  author = {Morteza Sadeghi},
  journal= {arXiv preprint arXiv:2511.21535},
  year   = {2025}
}