中文

利用多智能体方法自动化高性能计算生物作业中的容错

分布式、并行与集群计算 2014-03-04 v1 计算工程、金融与科学 多智能体系统

摘要

背景:高性能计算系统上的大规模生物作业如果其执行的一个或多个计算核心发生故障,则需要人工干预。这不仅增加了作业维护的成本,还增加了恢复作业所需的时间成本,以及在故障前丢失作业已完成的数据和执行成果的风险。能够主动检测计算核心故障并采取措施将核心作业重新定位到可靠核心的方法,可以在自动化容错方面迈出重要一步。方法:本文描述了一项关于使用多智能体方法进行容错的实验研究。研究了两种方法,第一种在作业级别,第二种在核心级别。针对计算机集群上执行并行归约算法时可能发生的单核心故障场景对这些方法进行了调查。提出了第三种方法,将多智能体技术同时纳入作业和核心级别。实验在基因组搜索这一流行的计算生物学应用背景下进行。结果:主要结论是,所提出的方法对于在最少人工干预的情况下自动化高性能计算系统中的容错是可行的。在研究容错的典型实验中,集中式和分布式检查点方法平均使作业实际执行时间增加了 90%。另一方面,在同一实验中,多智能体方法仅使总执行时间增加了 10%。

关键词

引用

@article{arxiv.1403.0500,
  title  = {Automating Fault Tolerance in High-Performance Computational Biological Jobs Using Multi-Agent Approaches},
  author = {Blesson Varghese and Gerard McKee and Vassil Alexandrov},
  journal= {arXiv preprint arXiv:1403.0500},
  year   = {2014}
}

备注

Computers in Biology and Medicine