Rover:基于广义迁移学习的在线 Spark SQL 调优服务
机器学习
2023-05-30 v2 分布式、并行与集群计算
摘要
像 Spark 这样的分布式数据分析引擎是工业界处理海量数据的常见选择。然而,Spark SQL 的性能高度依赖于配置的选择,而最优配置随所执行的工作负载而变化。在 Spark SQL 调优的各种方案中,贝叶斯优化(BO)是一个流行的框架,在给定足够预算下能找到近最优配置,但它存在重新优化问题,在实际生产中不实用。在将迁移学习应用于加速调优过程时,我们注意到两个领域特定的挑战:1)以往大多数工作侧重于迁移调优历史,而来自 Spark 工程师的专家知识具有提升调优性能的很大潜力,但迄今未被充分研究;2)历史任务应被谨慎利用,使用不相似的任务会导致生产中的性能下降。在本文中,我们提出 Rover,一个已部署的在线 Spark SQL 调优服务,用于在工业工作负载上进行高效且安全的搜索。为应对这些挑战,我们提出广义迁移学习,基于外部知识提升调优性能,包括专家辅助贝叶斯优化和受控历史迁移。在公开基准和真实任务上的实验显示了 Rover 相对于有竞争力的基线的优越性。值得注意的是,Rover 在 20 次迭代中为 12k 个真实世界 Spark SQL 任务平均节省了 50.1% 的内存成本,其中 76.2% 的任务实现了超过 60% 的显著内存降低。
引用
@article{arxiv.2302.04046,
title = {Rover: An online Spark SQL tuning service via generalized transfer learning},
author = {Yu Shen and Xinyuyang Ren and Yupeng Lu and Huaijun Jiang and Huanyong Xu and Di Peng and Yang Li and Wentao Zhang and Bin Cui},
journal= {arXiv preprint arXiv:2302.04046},
year = {2023}
}
备注
Accepted by KDD 2023