基于模仿学习的自动探索性数据分析方法——ILAEDA
机器学习
2024-10-16 v1 人工智能
数据库
摘要
自动化完成端到端的探索性数据分析(AutoEDA)是一个具有挑战性的开放问题,通常通过强化学习(RL)来实现,通过学习预测一系列分析操作(如 FILTER、GROUP 等)来实现。为每个操作定义奖励是一个具有挑战性的任务,而现有方法依赖各种“有趣性度量”来构建奖励函数,以捕捉每个操作的重要性。在本工作中,我们认为并非所有构成操作重要性关键特征的要素都能通过奖励函数准确地用数学方式捕捉。我们提出一种通过模仿学习从专家 EDA 会话中进行训练的 AutoEDA 模型,绕过手动定义有趣性度量的需求。我们的方法基于生成对抗式模仿学习(GAIL),能够在数据集之间良好地泛化,即使专家数据有限亦可如此。我们还引入了一种新的用于生成训练的合成 EDA 演示的方法。我们的方法在基准测试中超过现有最先进的端到端 EDA 方法高达 3 倍,显示出强大的性能和泛化能力,同时自然地捕捉了多样化的有趣性度量。
引用
@article{arxiv.2410.11276,
title = {ILAEDA: An Imitation Learning Based Approach for Automatic Exploratory Data Analysis},
author = {Abhijit Manatkar and Devarsh Patel and Hima Patel and Naresh Manwani},
journal= {arXiv preprint arXiv:2410.11276},
year = {2024}
}
备注
Accepted at AIMLSystems '24