中文

基于强化学习的自适应纠错 DRAM 错误缓解

分布式、并行与集群计算 2024-09-06 v1 机器学习

摘要

随着系统规模的扩大和当前可靠性水平,仅凭成本效益方法就无法满足硬件故障的缓解需求。内存中未被纠正的错误是硬件故障的主要原因之一,这类错误会终止当前作业并浪费自上次检查点以来的所有计算资源。本文提出了首个用于触发未被纠正错误缓解的自适应方法。该方法基于预测方法,考虑未被纠正错误的发生概率及其当前潜在成本。该方法基于强化学习,唯一的用户定义参数为缓解成本以及作业是否可从缓解点重新启动。我们使用经典机器学习指标以及成本效益分析进行评估,后者将缓解行动的成本与缓解部分错误所带来的收益进行比较。基于 MareNostrum 超级计算机两年的生产日志,我们的方法相较于无缓解措施时可减少 54% 的计算时间损失,仅比 optimal Oracle 方法差 6%。所有源代码均为开源。

关键词

引用

@article{arxiv.2407.16377,
  title  = {Reinforcement Learning-based Adaptive Mitigation of Uncorrected DRAM Errors in the Field},
  author = {Isaac Boixaderas and Sergi Moré and Javier Bartolome and David Vicente and Petar Radojković and Paul M. Carpenter and Eduard Ayguadé},
  journal= {arXiv preprint arXiv:2407.16377},
  year   = {2024}
}

备注

Published in HPDC'24