并行系统中容错与恢复技术概览
分布式、并行与集群计算
2007-05-23 v1
摘要
现今的超级计算系统通常以大量联网commodity系统构成的计算集群形式出现。这些系统如同其他分布式系统一样,由大量独立的硬件组件协作或协同完成计算。不幸的是,这些庞大数量的组件随时都可能发生故障,导致可能产生错误的输出。为了提高在故障存在下的超级计算应用程序的鲁棒性,已developed许多技术来抵御此类系统故障。本综述提供了这些各种容错技术的概览。
引用
@article{arxiv.cs/0501002,
title = {A Survey of Fault-Tolerance and Fault-Recovery Techniques in Parallel Systems},
author = {Michael Treaster},
journal= {arXiv preprint arXiv:cs/0501002},
year = {2007}
}
备注
11 pages