LMStream:当分布式微批流处理系统遇上 GPU
分布式、并行与集群计算
2021-11-09 v1
摘要
本文提出 LMStream,其在支持 GPU 的微批流处理系统中确保有界延迟的同时最大化吞吐量。LMStream 设计背后的主要思想可归纳为两种新机制:(1) 动态批处理与 (2) 动态算子级查询规划。通过控制微批大小,LMStream 显著降低了单个数据集的延迟,因为它并非仅为了提高 GPU 利用率而进行无条件缓冲。LMStream 根据流处理应用中使用的窗口操作特性,将延迟限制在一个最优值。基于数据大小和动态设备偏好的查询到执行设备的动态映射尽可能同时改善了吞吐量和延迟。此外,LMStream 提出了一种低开销的在线代价模型参数优化方法,且不中断实时流处理。我们在支持微批流处理的 Apache Spark 上实现了 LMStream。与先前面向吞吐量的方法相比,LMStream 的平均延迟最高改善了 70.7%,同时平均吞吐量最高提升至 1.74 倍。
引用
@article{arxiv.2111.04289,
title = {LMStream: When Distributed Micro-Batch Stream Processing Systems Meet GPU},
author = {Suyeon Lee and Sungyong Park},
journal= {arXiv preprint arXiv:2111.04289},
year = {2021}
}
备注
11 pages