中文

分布式数据中心中硬盘的大规模寿命终止预测

机器学习 2023-09-12 v2 分布式、并行与集群计算

摘要

每日,数据中心处理由廉价硬盘激增所支撑的海量数据。存储于这些磁盘中的数据服务于从金融、医疗到航空航天等一系列关键功能需求。因此,磁盘过早故障及随之而来的数据丢失可能是灾难性的。为降低故障风险,云存储提供商执行基于状态的监测,并在硬盘故障前予以更换。通过估计硬盘驱动器的剩余使用寿命,可预测特定设备至故障的时间并适时更换,从而在确保最大利用率的同时降低运营成本。本工作中,利用严重偏斜的健康统计数据,结合定制化特征工程与一组序列学习器,进行了大规模预测分析。已有工作表明使用 LSTM 作为预测剩余使用寿命的优良方法。为此,我们提出一种编码器–解码器 LSTM 模型,其中从理解健康统计序列获得的上下文有助于预测磁盘潜在故障前剩余天数的输出序列。本工作所开发的模型在来自 Backblaze 流通的全部 10 年 S.M.A.R.T. 健康数据及多种磁盘实例上进行了训练与测试。它弥合了全规模训练在数千台设备上所达效果的认知鸿沟,并通过为希望将工作流扩展至各厂商流通全年份健康数据的从业者提供切实评估与泛化指标,推进了当前最优水平。该编码器–解码器 LSTM 在详尽 10 年数据上训练期 RMSE 为 0.83、测试期 0.86,同时能在 Seagate 系列其他驱动器上具竞争力的泛化。

关键词

引用

@article{arxiv.2303.08955,
  title  = {Large-scale End-of-Life Prediction of Hard Disks in Distributed Datacenters},
  author = {Rohan Mohapatra and Austin Coursey and Saptarshi Sengupta},
  journal= {arXiv preprint arXiv:2303.08955},
  year   = {2023}
}

备注

8 pages, 9 figures and 6 tables