HPDedup:一种面向云主存储的混合优先级数据去重机制
分布式、并行与集群计算
2017-04-18 v2
摘要
消除云主存储中的重复数据既能提升云服务提供商的成本效益,也能降低用户使用云服务的成本。现有主存储去重技术要么利用内联缓存来挖掘主工作负载中的局部性,要么在系统空闲时运行后处理去重以避免对 I/O 性能的负面影响。然而,这两种方法在运行多种服务或应用的云服务器中均表现不佳,原因有二:其一,某些主存储工作负载中可能不存在重复数据写入的时间局部性,因此内联缓存往往难以达到良好的去重率;其二,后处理去重允许重复数据写入磁盘,因而无法提供 I/O 去重的收益,且需要较高的峰值存储容量。本文提出 HPDedup,一种混合优先级数据去重机制,通过融合内联与后处理过程实现精确去重,以应对由共位虚拟机或容器中运行的应用所共享的存储系统。在内联去重阶段,HPDedup 提供了一种指纹缓存机制,该机制估计来自不同虚拟机或应用的数据流中重复数据的时间局部性,并基于此估计为这些流分配缓存优先级。HPDedup 还允许根据数据流的空间局部性设置不同的去重阈值,以减少磁盘碎片。后处理阶段则从磁盘中移除那些因时间局部性弱而无法被缓存的指纹所对应的重复数据。实验结果表明,HPDedup 在内联缓存效率和主存储去重效率方面均明显优于当前最先进的主存储去重技术。
引用
@article{arxiv.1702.08153,
title = {HPDedup: A Hybrid Prioritized Data Deduplication Mechanism for Primary Storage in the Cloud},
author = {Huijun Wu and Chen Wang and Yinjin Fu and Sherif Sakr and Liming Zhu and Kai Lu},
journal= {arXiv preprint arXiv:1702.08153},
year = {2017}
}
备注
14 pages, 11 figures, submitted to MSST2017