PRESISTANT:基于学习的数据预处理助手
机器学习
2026-03-24 v1 数据库
摘要
数据预处理是数据分析过程(例如分类任务)中最耗时且最关键的步骤之一。给定的数据预处理算子(例如变换)可能对分析的最终结果产生正面、负面或零影响。专家用户具备找到正确预处理算子所需的知识。然而,对于非专家而言,他们被大量的预处理算子所淹没,并且很难找到会对他们的分析产生正面影响(例如提高分类器的预测准确率)的算子。现有方案要么假设用户具备专家知识,要么仅推荐在语法上可应用于数据集的预处理算子,而未考虑其对最终分析的影响。在本文中,我们旨在通过推荐依据其对最终分析的影响排序的数据预处理算子,为非专家用户提供协助。我们开发了一款工具 PRESISTANT,它使用随机森林(Random Forests)来学习预处理算子对 5 种不同分类算法(如 J48、朴素贝叶斯、PART、逻辑回归和最近邻)性能(例如预测准确率)的影响。对我们工具所提供推荐的广泛评估表明,PRESISTANT 能有效帮助非专家在其分析任务中取得改进的结果。
引用
@article{arxiv.1803.01024,
title = {PRESISTANT: Learning based assistant for data pre-processing},
author = {Besim Bilalli and Alberto Abelló and Tomàs Aluja-Banet and Robert Wrembel},
journal= {arXiv preprint arXiv:1803.01024},
year = {2026}
}