数据湖机器学习基准LakeMLB
机器学习
2026-02-12 v1 人工智能
摘要
数据湖作为大规模机器学习的基础平台,已成为灵活存储异构数据并通过表导向抽象实现结构化分析的关键技术。尽管其重要性日益提升,但用于评估数据湖环境下机器学习性能的标准化基准仍显不足。为填补这一空白,我们提出LakeMLB(数据湖机器学习基准),旨在覆盖数据湖中最常见的多源、多表场景。LakeMLB聚焦两种典型的多表场景:Union 和 Join,并为每种场景提供三个真实数据集,涵盖政府公开数据、金融领域、维基百科及线上市场等。基准支持三种典型的集成策略:预训练式、数据增强式及特征增强式。我们对主流表格学习方法进行大规模实验,洞察其在复杂数据湖情景下的表现。我们公开数据集和代码以促进数据湖生态系统中机器学习研究的严谨性;基准已发布于 https://github.com/zhengwang100/LakeMLB。
引用
@article{arxiv.2602.10441,
title = {LakeMLB: Data Lake Machine Learning Benchmark},
author = {Feiyu Pan and Tianbin Zhang and Aoqian Zhang and Yu Sun and Zheng Wang and Lixing Chen and Li Pan and Jianhua Li},
journal= {arXiv preprint arXiv:2602.10441},
year = {2026}
}
备注
8 pages, 4 figures. Preprint