PACEMAKER:在存储集群中以磁盘自适应冗余避免HeART故障
分布式、并行与集群计算
2021-03-16 v1
摘要
数据冗余为大规模存储集群提供弹性,但带来显著的成本开销。通过将冗余方案调整到观测到的磁盘故障率,可以实现可观的空间节省。然而,此类调优的既有设计方案在真实集群中不可用,因为方案间转换的IO负载会压垮存储基础设施(称为转换过载)。本文分析了来自Google、NetApp和Backblaze生产系统中数百万块磁盘的迹线,揭示并将转换过载理解为磁盘自适应冗余的障碍:现有方法下的转换IO可连续数周持续消耗100%的集群IO。基于所得见解,我们提出PACEMAKER,一种低开销的磁盘自适应冗余编排器。PACEMAKER通过以下方式缓解转换过载:(1)主动组织数据布局以使未来转换高效;(2)主动发起转换,在避免紧迫性的同时不损害空间节省。利用来自四个大型(11万-45万块磁盘)生产集群的迹线对PACEMAKER的评估表明,转换IO需求降低至从不需超过5%的集群IO带宽(平均0.2-0.4%)。PACEMAKER在提供14-20%总体空间节省且从不使数据保护不足的情况下实现了这一点。我们还描述并实验了将PACEMAKER集成到HDFS中。
引用
@article{arxiv.2103.08191,
title = {PACEMAKER: Avoiding HeART attacks in storage clusters with disk-adaptive redundancy},
author = {Saurabh Kadekodi and Francisco Maturana and Suhas Jayaram Subramanya and Juncheng Yang and K. V. Rashmi and Gregory R. Ganger},
journal= {arXiv preprint arXiv:2103.08191},
year = {2021}
}
备注
Published in USENIX Symposium on Operating Systems Design and Implementation (OSDI) 2020