DeepSketch:一种用于后去重增量压缩的基于机器学习的新参考搜索技术
机器学习
2022-02-23 v1
摘要
存储系统中的数据缩减作为降低数据中心管理成本的有效方案正变得日益重要。为最大化数据缩减效率,现有的后去重增量压缩技术在传统数据去重和无损压缩的基础上执行增量压缩。遗憾的是,我们观察到现有技术由于在识别相似数据块方面精度有限,其数据缩减比显著低于最优值。在本文中,我们提出 DeepSketch,一种用于后去重增量压缩的新参考搜索技术,它利用学习哈希(learning-to-hash)方法在增量压缩的参考搜索中实现更高精度,从而提升数据缩减效率。DeepSketch 使用深度神经网络提取数据块的草图(sketch),即创建该块的近似数据签名,以保留与其他块的相似性。我们使用十一个真实工作负载的评估表明,与最先进(SOTA)的后去重增量压缩技术相比,DeepSketch 将数据缩减比提高了至多 33%(平均 21%)。
引用
@article{arxiv.2202.10584,
title = {DeepSketch: A New Machine Learning-Based Reference Search Technique for Post-Deduplication Delta Compression},
author = {Jisung Park and Jeoggyun Kim and Yeseong Kim and Sungjin Lee and Onur Mutlu},
journal= {arXiv preprint arXiv:2202.10584},
year = {2022}
}
备注
Full paper to appear in USENIX FAST 2022