在 CPU 和 GPU 上利用扩展 BLAS 核进行张量缩并
分布式、并行与集群计算
2018-08-15 v2
摘要
张量缩并构成了数值多线性代数的关键计算要素。然而,随着张量的阶数和维度的增长,基于张量的计算的时间和空间复杂度也迅速增加。现有的张量缩并方法通常涉及显式的复制和转置操作。在本文中,我们提出并评估了一种新的类 BLAS 原语 STRIDEDBATCHEDGEMM,它能够在 CPU 和 GPU 上高效地执行广泛的张量缩并。通过系统的基准测试,我们展示了我们的方法相对于传统方法的优势。具体而言,我们实现了 Tucker 分解,并表明与使用现有最先进库的实现相比,使用我们的内核实现了 100 倍的加速。
引用
@article{arxiv.1606.05696,
title = {Tensor Contractions with Extended BLAS Kernels on CPU and GPU},
author = {Yang Shi and U. N. Niranjan and Animashree Anandkumar and Cris Cecka},
journal= {arXiv preprint arXiv:1606.05696},
year = {2018}
}