中文

数据中心存储系统中比特损坏的在线恢复

分布式、并行与集群计算 2018-05-10 v2

摘要

由于其高性能与每比特成本的下降,闪存正成为数据中心中热数据的主要存储介质。然而,闪存耐久性是长期存在的问题,并且由于技术趋势,后续几代闪存器件在经历不可纠正比特错误前的寿命 progressively 缩短。在本文中,我们提出通过允许器件暴露更高的比特错误率来延长闪存寿命。为此,我们提出 DIRECT,一组新颖的策略,利用分布式存储系统中的潜在冗余,以最小性能和恢复开销从比特损坏错误中恢复。借此,DIRECT 可显著延长闪存器件寿命,即使在器件开始暴露比特错误后仍能高效利用。我们在两个真实存储系统上实现了 DIRECT:ZippyDB(由 RocksDB 支撑的分布式键值存储)和 HDFS(分布式文件系统)。在 Facebook 的生产轨迹上测试时,DIRECT 将 ZippyDB 中应用可见错误率降低超过 10^2,恢复时间减少超过 10^4。DIRECT 还使 HDFS 能够容忍高出 10^4--10^5 的比特错误率而不出现应用可见错误。

关键词

引用

@article{arxiv.1805.02790,
  title  = {Live Recovery of Bit Corruptions in Datacenter Storage Systems},
  author = {Amy Tai and Andrew Kryczka and Shobhit Kanaujia and Chris Petersen and Mikhail Antonov and Muhammad Waliji and Kyle Jamieson and Michael J. Freedman and Asaf Cidon},
  journal= {arXiv preprint arXiv:1805.02790},
  year   = {2018}
}