强化近似探索性数据分析
机器学习
2022-12-14 v1 人工智能
数据库
摘要
探索性数据分析(EDA)是一个序贯决策过程,分析师基于先前的查询及相应结果选择后续查询,以可能产生某些有趣洞察。数据处理系统常在样本上执行查询以低延迟产生结果。不同的下采样策略保留数据的不同统计量,并具有不同幅度的延迟降低。采样策略的最优选择通常取决于分析流的具体上下文和分析师的隐藏意图。在本文中,我们首次考虑了在交互式数据探索设置中采样的影响,因其引入了近似误差。我们提出了一种基于深度强化学习(DRL)的框架,可优化样本选择以保持分析和洞察生成流的完整性。对 3 个真实数据集的评估表明,与基线方法相比,我们的技术能在改善交互延迟的同时保持原始洞察生成流。
引用
@article{arxiv.2212.06225,
title = {Reinforced Approximate Exploratory Data Analysis},
author = {Shaddy Garg and Subrata Mitra and Tong Yu and Yash Gadhia and Arjun Kashettiwar},
journal= {arXiv preprint arXiv:2212.06225},
year = {2022}
}
备注
Appears in the 37th AAAI Conference on Artificial Intelligence (AAAI), 2023