中文

并行系统中容错与恢复技术概览

分布式、并行与集群计算 2007-05-23 v1

摘要

现今的超级计算系统通常以大量联网commodity系统构成的计算集群形式出现。这些系统如同其他分布式系统一样,由大量独立的硬件组件协作或协同完成计算。不幸的是,这些庞大数量的组件随时都可能发生故障,导致可能产生错误的输出。为了提高在故障存在下的超级计算应用程序的鲁棒性,已developed许多技术来抵御此类系统故障。本综述提供了这些各种容错技术的概览。

关键词

引用

@article{arxiv.cs/0501002,
  title  = {A Survey of Fault-Tolerance and Fault-Recovery Techniques in Parallel Systems},
  author = {Michael Treaster},
  journal= {arXiv preprint arXiv:cs/0501002},
  year   = {2007}
}

备注

11 pages