调节查询并行度的机器学习技术的比较探索
数据库
2020-05-22 v2
摘要
近期有大量工作将机器学习(ML)技术应用于关系数据库管理系统(RDBMSs)中的查询优化和查询性能预测。然而,这些工作通常忽略了内部并行性对查询性能预测的影响,而内部并行性在实践中是用于提升OLAP查询性能的关键组件。在本文中,我们迈出了填补这一空白的第一步,在Microsoft SQL Server这一允许单个查询使用多核执行的流行商业RDBMS中,研究了通过ML技术调节并行度的问题。在我们的研究中,我们将DOP调节问题转化为一个回归任务,并研究了几种流行的ML模型如何有助于多核环境下的查询性能预测。我们探索了设计空间,并进行了广泛的实验研究,根据一系列性能指标比较了不同模型,测试了它们在不同设置下的泛化能力: 来自同一模板的查询, 来自新模板的查询, 不同规模的实例,以及 不同的实例和查询。我们的实验结果表明,忽略代价模型估计的输入查询计划的简单特征化可以准确预测查询性能,捕获相对于可用并行性的加速趋势,并有助于自动选择每个查询的最优DOP。
引用
@article{arxiv.2005.08439,
title = {A Comparative Exploration of ML Techniques for Tuning Query Degree of Parallelism},
author = {Zhiwei Fan and Rathijit Sen and Paraschos Koutris and Aws Albarghouthi},
journal= {arXiv preprint arXiv:2005.08439},
year = {2020}
}