中文

MERIT:面向并行架构上内存高效视觉处理的张量变换

分布式、并行与集群计算 2019-11-12 v1 硬件体系结构

摘要

计算密集型的深度神经网络(DNNs)很适合在 GPU 上运行,但新开发的算法通常要求高度优化的 DNN 例程才能高效工作,而对于专用 DNN 架构这一问题可能更为困难。在本文中,我们提出了一种数学表述,可用于跨计算平台迁移算法优化知识。我们发现,并行处理器架构内的数据移动与存储可视为跨内存层级的张量变换,从而得以用数学方式描述许多内存优化技术。这一我们称之为内存高效范围内积张量(MERIT)变换的变换,不仅可应用于 DNN 任务,也可用于许多传统机器学习与计算机视觉计算。此外,张量变换可轻松映射到现有向量处理器架构。在本文中,我们展示了许多流行应用可在 GPU 上转换为简洁的 MERIT 记号,在仅使用一半代码量的同时最高加速 GPU 核函数达 20 倍。我们还利用所提变换的原理设计了一种称为 MERIT-z 处理器的专用硬件单元。该处理器可应用于多种 DNN 任务及其他计算机视觉任务,同时提供与专用 DNN ASIC 相当的面积与功耗效率。

关键词

引用

@article{arxiv.1911.03458,
  title  = {MERIT: Tensor Transform for Memory-Efficient Vision Processing on Parallel Architectures},
  author = {Yu-Sheng Lin and Wei-Chao Chen and Shao-Yi Chien},
  journal= {arXiv preprint arXiv:1911.03458},
  year   = {2019}
}