面向大数据应用的内存分解内存对象存储框架
分布式、并行与集群计算
2022-04-28 v1 硬件体系结构
摘要
内存分解的概念近期在研究领域日益受到关注。通过内存分解,数据中心计算节点可以直接访问相邻节点上的内存,从而克服本地内存限制,为分布式计算引入新的数据管理范式。本文利用新引入的 ThymesisFlow 内存分解系统,提出并演示了一个面向大数据应用的内存分解内存对象存储框架。该框架将已有的 Apache Arrow Plasma 对象存储框架的功能扩展到分布式系统,使客户端能够轻松高效地在多个计算节点间生产和消费数据对象。这使得大数据应用能够以更低的开发成本越来越多地利用并行处理。此外,本文还包括延迟和吞吐量测量,表明远程分解内存访问相较于本地访问仅产生适度的性能损失(约 6.5 vs 约 5.75 GiB/s)。这些结果可用于指导未来利用内存分解的系统以及本文新提出的框架的设计。本工作为开源项目,可在 https://doi.org/10.5281/zenodo.6368998 公开获取。
引用
@article{arxiv.2204.12889,
title = {Memory-Disaggregated In-Memory Object Store Framework for Big Data Applications},
author = {Robin Abrahamse and Akos Hadnagy and Zaid Al-Ars},
journal= {arXiv preprint arXiv:2204.12889},
year = {2022}
}
备注
Accepted by COMPSYS22 workshop