中文

面向高性能计算的非易失性内存中算法导向的崩溃一致性

分布式、并行与集群计算 2017-05-17 v1

摘要

容错是高性能计算(HPC)的主要设计目标之一。非易失性存储器(NVM)的出现为构建容错 HPC 提供了解决方案。由于 NVM 的非易失性,基于 NVM 的主存中的数据在系统崩溃时不会丢失。然而,由于易失性缓存,必须记录数据并在崩溃前显式地将数据从缓存刷新到 NVM 以确保一致性和正确性,这会导致较大的运行时开销。本文中,我们引入一种基于算法的方法,为 HPC 应用建立 NVM 中的崩溃一致性。我们轻微扩展应用数据结构或稀疏地刷新缓存块,这带来了可忽略的运行时开销。此类扩展或缓存刷新使我们能够利用算法知识来推断数据一致性或在应用崩溃时纠正不一致数据。我们针对三种算法展示了方法的有效性,包括迭代求解器、稠密矩阵乘法和蒙特卡洛模拟。基于多种测试环境下的综合性能评估,我们证明该方法具有极小的运行时开销(至多 8.2%,多数情况下低于 3%),远小于传统检查点,同时具有相同或更少的重计算代价。

关键词

引用

@article{arxiv.1705.05541,
  title  = {Algorithm-Directed Crash Consistence in Non-Volatile Memory for HPC},
  author = {Shuo Yang and Kai Wu and Yifan Qiao and Dong Li and Jidong Zhai},
  journal= {arXiv preprint arXiv:1705.05541},
  year   = {2017}
}

备注

12 pages