面向流式数据处理的更优写放大
分布式、并行与集群计算
2023-06-07 v1
摘要
许多当前应用必须以流式方式执行数据处理。大规模地进行此类处理需要一个并行系统,该系统必须能够处理掉队工作节点和各类故障。YT 是 Yandex 内部分布式系统的主要驱动者,承载其分布式文件系统、锁服务、键值存储和内部 MapReduce 平台。我们实现了该系统的一个新组件,专为执行流式 MapReduce 操作而设计,利用不同的核心 YT 解决方案来实现容错性和精确一次(exactly-once)语义,同时保持效率和低写放大系数。
引用
@article{arxiv.2306.03272,
title = {Better Write Amplification for Streaming Data Processing},
author = {Andrei Chulkov and Maxim Akhmedov},
journal= {arXiv preprint arXiv:2306.03272},
year = {2023}
}
备注
YT is now openly available as YTSaurus: see github.com/ytsaurus/ytsaurus