中文

通过简化训练数据集来优化基数估计模型的预训练

数据库 2025-05-29 v2 机器学习

摘要

基数估计是查询优化研究的关键方面,其性能随机器学习的集成而显著提高。为克服“冷启动”问题或学习型基数估计器模型的迁移性不足,一些采用跨多个数据集和相应工作负载进行学习的预训练基数估计模型被提出。这些模型通常在由均匀抽样自多个数据集创建的数据集上进行训练,但这种方法可能并非最佳。通过将 Group 分布性鲁棒优化(Group DRO)算法应用于训练数据集,我们发现某些特定的训练数据集对模型性能的贡献远大于其他数据集。基于这一观察,我们进行大量实验以深入研究预训练基数估计器。我们的结果表明,这些模型的性能受数据集及其相应工作负载的影响。最后,我们引入了一个简化的训练数据集,其规模仅为现有预训练数据集的部分份之一。充分的实验结果表明,基于此简化数据集预训练的基数估计器在零样本设置下仍能实现与现有模型相当的性能。

关键词

引用

@article{arxiv.2502.14350,
  title  = {Optimize Cardinality Estimation Model Pretraining by Simplifying the Training Datasets},
  author = {Boyang Fang},
  journal= {arXiv preprint arXiv:2502.14350},
  year   = {2025}
}

备注

Preliminary analysis uncovered data quality concerns in our experimental dataset