面向FPGA上稀疏矩阵化张量乘Khatri-Rao积的可重构低延迟存储系统
硬件体系结构
2021-09-21 v1 人工智能
分布式、并行与集群计算
摘要
张量分解已成为包括机器学习在内的多个领域众多应用中的重要工具。稀疏矩阵化张量乘Khatri-Rao积(MTTKRP)是张量计算中最耗费计算资源的核之一。尽管具有显著的计算并行性,MTTKRP因其不规则的内存访问特征而难以优化。本文关注一个多面存储系统,其探索了MTTKRP数据结构的空间与时间局部性。此外,用户可根据FPGA加速器中所用计算单元的行为重新配置我们的设计。我们的系统利用分布式缓存与直接内存访问(DMA)子系统,在减少总内存访问时间的同时高效访问所有MTTKRP数据结构。而且,与商用内存控制器IP相比,我们的工作将内存访问时间改善了3.5倍。同时,与仅缓存和仅DMA的存储系统相比,我们的系统分别显示出2倍和1.26倍的加速。
引用
@article{arxiv.2109.08874,
title = {Reconfigurable Low-latency Memory System for Sparse Matricized Tensor Times Khatri-Rao Product on FPGA},
author = {Sasindu Wijeratne and Rajgopal Kannan and Viktor Prasanna},
journal= {arXiv preprint arXiv:2109.08874},
year = {2021}
}