面向云生产环境中基于机器学习的磁盘故障预测的鲁棒数据预处理
机器学习
2019-12-23 v1 分布式、并行与集群计算
机器学习
摘要
为现代云数据中心提供主动容错,已有大量研究提出机器学习(ML)方法以预测即将发生的磁盘故障并进行早期补救,并直接在公开数据集(如 Backblaze SMART 日志)上评估其方法。然而,在真实生产环境中,数据质量并不完善(例如标注不准确、数据样本缺失以及故障类型复杂),从而降低了预测精度。我们提出 RODMAN,一种鲁棒的数据预处理流水线,在将数据送入 ML 模型之前对样本进行精炼。我们从一个由阿里巴巴云数据中心超过三百万块磁盘驱动的大规模轨迹研究入手,并阐明基于 ML 的磁盘故障预测中的实际挑战。随后我们设计了 RODMAN,包含三种适用于通用 ML 模型的数据预处理技术,即故障类型过滤、基于样条的数据填充以及自动化故障前回溯。在阿里巴巴和 Backblaze 数据集上的评估表明,在各种设置下,RODMAN 相比无数据预处理均提升了预测精度。
引用
@article{arxiv.1912.09722,
title = {Robust Data Preprocessing for Machine-Learning-Based Disk Failure Prediction in Cloud Production Environments},
author = {Shujie Han and Jun Wu and Erci Xu and Cheng He and Patrick P. C. Lee and Yi Qiang and Qixing Zheng and Tao Huang and Zixi Huang and Rui Li},
journal= {arXiv preprint arXiv:1912.09722},
year = {2019}
}
备注
12 pages, 9 figures