CUDA统一内存中高级特性的性能评估
分布式、并行与集群计算
2020-03-03 v1
摘要
CUDA统一内存提升了GPU的可编程性,并支持GPU内存超额订阅。近来,两项高级内存特性——内存建议(memory advises)与异步预取(asynchronous prefetch)被引入。本文在两个具有不同CPU、GPU及互连结构的平台上评估这些新特性。我们为实验推导了一套基准测试程序,并对内存系统施加压力以评估内存内与超额订阅两种场景下的性能。结果表明,在Intel-Volta/Pascal-PCIe平台上,内存建议对内存内执行的提升微乎其微。然而,当GPU内存超额订阅约50%时,使用内存建议相比基础CUDA统一内存带来最高25%的性能提升。相比之下,Power9-Volta-NVLink平台可从内存建议中大幅获益,在内存内执行中取得最高34%的性能增益。但当该平台GPU内存被超额订阅时,使用内存建议会增加GPU页错误并导致明显的性能损失。CUDA预取在两平台上的性能影响亦不同:在Intel-Volta/Pascal-PCIe平台上最高提升50%性能,而对Power9-Volta-NVLink平台几乎无益。
引用
@article{arxiv.1910.09598,
title = {Performance Evaluation of Advanced Features in CUDA Unified Memory},
author = {Steven W. D. Chien and Ivy B. Peng and Stefano Markidis},
journal= {arXiv preprint arXiv:1910.09598},
year = {2020}
}
备注
Accepted for publication at Workshop on Memory Centric High Performance Computing (MCHPC'19) in SC19