中文

云端数百万查询的迁移之路

数据库 2022-05-19 v1

摘要

Treasure Data 每天在云端处理数百万条分布式 SQL 查询。在此规模上升级查询引擎服务颇具挑战,因为我们需要将客户的所有生产查询迁移到新版本,同时保持数据处理管道的正确性与性能。为保障查询引擎质量,我们利用查询日志构建客户专属基准,并在安全的预生产环境中使用真实客户数据重放这些查询。为模拟数百万条查询,我们需要有效地最小化测试查询集并更好地报告模拟结果,以主动发现不兼容变更及新版本的性能回退。本文描述了我们系统的整体设计,并分享了在维护云端查询引擎服务质量过程中的各类挑战。

关键词

引用

@article{arxiv.2205.08664,
  title  = {Journey of Migrating Millions of Queries on The Cloud},
  author = {Taro L. Saito and Naoki Takezoe and Yukihiro Okada and Takako Shimamoto and Dongmin Yu and Suprith Chandrashekharachar and Kai Sasaki and Shohei Okumiya and Yan Wang and Takashi Kurihara and Ryu Kobayashi and Keisuke Suzuki and Zhenghong Yang and Makoto Onizuka},
  journal= {arXiv preprint arXiv:2205.08664},
  year   = {2022}
}

备注

This version is published in DBTest '22: Proceedings of the 2022 workshop on 9th International Workshop of Testing Database Systems