中文

眨眼之间的太字节级分析

数据库 2025-08-05 v2 分布式、并行与集群计算 性能

摘要

过去二十年来,数据库领域投入了大量研究来利用廉价的机器集群进行分布式数据分析——我们认为我们正处于范式转变的开端。AI 模型的扩展定律和流行度促使商业数据中心部署了极其强大的 GPU 集群。与仅使用 CPU 的解决方案相比,这些集群在单节点计算能力、内存带宽和节点间互联性能方面带来了显著提升。本文研究了在 GPU 分布式集群上扩展分析型 SQL 查询的问题,旨在建立可能性能提升的上界。为此,我们构建了一个原型系统,通过利用机器学习/高性能计算的最佳实践(如用于跨设备数据移动的群通信原语)来最大化性能。这使我们能够进行全面的性能实验,为我们的社区指出了至少 60 倍的巨大性能提升空间。为了让这些提升更直观,在你眨眼两次之前,我们的系统就能以 1TB 的规模因子运行 TPC-H 的全部 22 个查询!

关键词

引用

@article{arxiv.2506.09226,
  title  = {Terabyte-Scale Analytics in the Blink of an Eye},
  author = {Bowen Wu and Wei Cui and Carlo Curino and Matteo Interlandi and Rathijit Sen},
  journal= {arXiv preprint arXiv:2506.09226},
  year   = {2025}
}