MLPrE -- 面向机器学习模型构建的数据预处理与探索性数据分析工具
机器学习
2025-10-30 v1
摘要
随着深度学习在AI中的快速发展,亟需工具来满足日益增长的数据输入需求。某些情况下,源数据可能以多种格式存在,因此必须对其进行调查和适当的工程化处理,以适用于机器学习模型或图数据库。现有工作流程的开销和可扩展性不足限制了其在诸如Apache Airflow等更大数据处理管道中的集成,推动了需要一个稳健、可扩展且轻量级的工具来预处理任意数据集以实现规模化的数据类型和大小适应。为此,我们提出机器学习预处理与探索性数据分析工具 (MLPrE),其中利用 SparkDataFrames 在处理期间保存数据以确保可扩展性。采用通用 JSON 输入文件格式描述对DataFrame的分步骤变更。实现了输入/输出、过滤、基本统计、特征工程和探索性数据分析等阶段。在MLPrE中实现了69个阶段,其中我们通过六个多样化数据集演示并重点展示了关键阶段。我们进一步展示了MLPrE独立处理平面文件中多个字段并重新组合的能力,这通常需要额外的管道,示例为 UniProt 术语数据集。基于这一优势,我们使用可用酒质量数据演示了聚类阶段。最后,我们在MLPrE的后期阶段中演示了如何为图数据库准备数据,示例为磷酸化酶数据。总体而言,MLPrE工具为数据预处理和早期数据分析提供了通用且可扩展的解决方案,填补了鉴于机器学习日益增长应用的关键需求。该工具加速并简化了更大规模工作流程中的早期开发。
引用
@article{arxiv.2510.25755,
title = {MLPrE -- A tool for preprocessing and exploratory data analysis prior to machine learning model construction},
author = {David S Maxwell and Michael Darkoh and Sidharth R Samudrala and Caroline Chung and Stephanie T Schmidt and Bissan Al-Lazikani},
journal= {arXiv preprint arXiv:2510.25755},
year = {2025}
}