MeLoPPR:面向内存高效低延迟个性化 PageRank 的软硬件协同设计
分布式、并行与集群计算
2021-04-21 v1 硬件体系结构
摘要
个性化 PageRank(PPR)是一种从源节点评估周边节点重要性的图算法。PPR 广泛用于推荐系统等社交网络相关应用,需要实时响应(延迟)以获得更好用户体验。现有工作要么侧重于提升精度的算法优化而忽略硬件实现,要么侧重于大规模系统上的分布式全局图处理以提升吞吐而非响应时间。在边缘设备上以紧内存预算优化低延迟局部 PPR 算法仍属空白。本工作中,我们提出一种内存高效、低延迟的 PPR 方案,即 MeLoPPR,其大幅降低内存需求并在延迟与精度间提供灵活权衡。MeLoPPR 由阶段分解与线性分解组成,并利用节点分数稀疏性:通过阶段与线性分解,MeLoPPR 将大图上的计算拆为一组较小子图,显著节省计算内存;通过稀疏性利用,MeLoPPR 选择性地选取对精度贡献最大的子图以减少所需计算。此外,通过软硬件协同设计,我们在混合 CPU 与 FPGA 加速平台上提出硬件实现,进一步加速子图计算。我们在包括个人笔记本电脑与 Xilinx Kintex-7 KC705 FPGA 在内的内存受限设备上使用六个真实世界图评估所提 MeLoPPR。首先,MeLoPPR 在 CPU 上实现 1.5 倍至 13.4 倍、在 FPGA 上 73 倍至 8699 倍显著内存节省。其次,MeLoPPR 允许精度与执行时间间的灵活权衡:当精度为 80% 时,CPU 上加速比达 15 倍、FPGA 上达 707 倍;当精度约 90% 时,FPGA 上加速比达 70 倍。
引用
@article{arxiv.2104.09616,
title = {MELOPPR: Software/Hardware Co-design for Memory-efficient Low-latency Personalized PageRank},
author = {Lixiang Li and Yao Chen and Zacharie Zirnheld and Pan Li and Cong Hao},
journal= {arXiv preprint arXiv:2104.09616},
year = {2021}
}
备注
Accepted by IEEE Design Automation Conference, 2021 (DAC'21). Six pages