中文

面向缓存无关 TU 分解的空间填充曲线比较研究

符号计算 2016-12-20 v1

摘要

我们考察了几种基于空间填充曲线的矩阵布局,这些布局允许对有限域上矩形矩阵的并行 TU 分解进行缓存无关的自适应。\cite{Dumas} 的 TU 算法需要索引转换例程,其编码和解码所选曲线的成本是显著的。通过对编码和解码过程所需位操作数的详细分析,并过滤掉表示希尔伯特曲线递归分解的查找表成本,我们表明,与希尔伯特、皮亚诺或莫顿序相比,莫顿混合序在整个矩阵分解过程中所需的索引转换例程成本最低。其动机在于,自然顺序评估顺序表现出较低缓存未命中率的缓存高效并行自适应,可在具有私有或共享缓存的并行机、GPU 甚至云计算平台上带来整体更快的性能。我们报告了初步实验,展示了莫顿混合布局下的 TURBO 算法如何随着输入矩阵大小的增加而获得数量级的性能提升。例如,当 N=213N = 2^{13} 时,行主序 TURBO 算法在约 38.6 小时内完成,而截断大小等于 6464 的莫顿混合算法在 10.6 小时内完成。

关键词

引用

@article{arxiv.1612.06069,
  title  = {Comparative study of space filling curves for cache oblivious TU Decomposition},
  author = {Fatima K. Abu Salem and Mira Al Arab},
  journal= {arXiv preprint arXiv:1612.06069},
  year   = {2016}
}