中文

基于学习成本模型的 SQL 负载跨引擎优化器

计算与语言 2025-10-16 v3 计算机视觉与模式识别

摘要

Lakehouse 系统允许使用多个执行引擎查询同一数据。然而,选择最适合运行 SQL 查询的引擎仍需要预先了解查询的计算需求和引擎能力,这是一项复杂的手工任务,且随着新引擎和负载的出现变得更加困难。在本文中,我们通过提出一种跨引擎优化器来解决这一局限性,该优化器能够通过学习成本模型自动为各种 SQL 查询选择引擎。带有提示优化的查询计划被用于查询成本预测和路由。成本预测被表述为一个多任务学习问题,模型架构中使用了对应不同引擎和配置的多个预测头。这消除了训练特定引擎模型的需要,并允许以最小的微调成本灵活添加新引擎。在多种数据库和引擎上的结果表明,使用经过查询优化的逻辑计划进行成本估计,相比使用未优化计划作为输入,可将平均 Q-error 降低 12.6%。此外,与随机路由相比,所提出的跨引擎优化器在零样本设置下将总负载运行时间减少了 25.2%,在小样本设置下减少了 30.4%。

关键词

引用

@article{arxiv.2506.02803,
  title  = {SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking},
  author = {Sifan Li and Yujun Cai and Yiwei Wang},
  journal= {arXiv preprint arXiv:2506.02803},
  year   = {2025}
}