面向缓存无关 TU 分解的空间填充曲线比较研究
符号计算
2016-12-20 v1
摘要
我们考察了几种基于空间填充曲线的矩阵布局,这些布局允许对有限域上矩形矩阵的并行 TU 分解进行缓存无关的自适应。\cite{Dumas} 的 TU 算法需要索引转换例程,其编码和解码所选曲线的成本是显著的。通过对编码和解码过程所需位操作数的详细分析,并过滤掉表示希尔伯特曲线递归分解的查找表成本,我们表明,与希尔伯特、皮亚诺或莫顿序相比,莫顿混合序在整个矩阵分解过程中所需的索引转换例程成本最低。其动机在于,自然顺序评估顺序表现出较低缓存未命中率的缓存高效并行自适应,可在具有私有或共享缓存的并行机、GPU 甚至云计算平台上带来整体更快的性能。我们报告了初步实验,展示了莫顿混合布局下的 TURBO 算法如何随着输入矩阵大小的增加而获得数量级的性能提升。例如,当 时,行主序 TURBO 算法在约 38.6 小时内完成,而截断大小等于 的莫顿混合算法在 10.6 小时内完成。
引用
@article{arxiv.1612.06069,
title = {Comparative study of space filling curves for cache oblivious TU Decomposition},
author = {Fatima K. Abu Salem and Mira Al Arab},
journal= {arXiv preprint arXiv:1612.06069},
year = {2016}
}