在基于 CPU-GPU 混合架构上利用非阿贝尔对称性提升大规模并行张量网络态算法的有效性能
计算物理
2023-10-02 v1 强关联电子
化学物理
量子物理
摘要
我们提出了新颖的算法方案及实现细节,利用非阿贝尔对称性以提升张量网络态算法在高性能计算基础设施上的当前极限。在我们内部开发的混合 CPU-多 GPU 解决方案中,调度是去中心化的,线程自主,且线程间通信仅限于与全局可见无锁结构的交互。我们定制的虚拟内存管理确保数据以高空间局部性产生,这与特定序列的跨步批处理矩阵运算结合转化为显著更高的整体吞吐量。为降低 IO 开销,采用自适应缓冲技术将构建和复用的缓存仓库的数据抽象层级动态匹配到系统资源。基于 Wigner-Eckhart 定理的非阿贝尔对称性相关张量代数完全从常规张量网络层剥离,从而可无额外开销地执行大规模并行矩阵与张量运算。总体而言,相较于 arXiv:2305.05581 中报道的结果,我们在计算复杂度上实现了一个数量级的性能提升,同时在实际以 TFLOPS 衡量的性能上达到三到六倍。基准结果在高达 的希尔伯特空间维度上给出,通过选定强关联分子系统上的大规模 SU(2) 自旋适配密度矩阵重整化群模拟获得。这些结果展示了 NVIDIA 高度专用的张量核的利用,在配备八块 NVIDIA A100 设备的单节点上实现约 110 TFLOPS 的性能。与精度匹配的 U(1) 实现相比,我们的方案估计有效性能为 250-500 TFLOPS。
引用
@article{arxiv.2309.16724,
title = {Boosting the effective performance of massively parallel tensor network state algorithms on hybrid CPU-GPU based architectures via non-Abelian symmetries},
author = {Andor Menczer and Örs Legeza},
journal= {arXiv preprint arXiv:2309.16724},
year = {2023}
}
备注
16 pages, 6 figures