FeatAug: 从一对多关系表中自动进行特征增强
机器学习
2024-03-12 v1 数据库
摘要
从一对多关系表中进行特征增强是机器学习模型开发中一个关键但极具挑战性的问题。为了增强优良特征,数据科学家需要手动编写 SQL 查询,这非常耗时。Featuretools [1] 是数据科学界广泛使用的工具,通过从相关表中提取新特征来自动增强训练数据。它将每个特征表示为相关表上的分组聚合 SQL 查询,并能自动生成这些 SQL 查询。然而,这些查询中不包含谓词,这极大限制了其在许多实际场景中的应用。为了克服这一局限性,我们提出了 FEATAUG,一种新的特征增强框架,能够从一对多关系表中自动提取谓词感知的 SQL 查询。这一扩展并非易事,因为考虑谓词将使候选查询数量呈指数级增长。因此,将所有候选查询物化的原始 Featuretools 框架将无法工作,需要重新设计。我们正式定义了该问题,并将其建模为超参数优化问题。我们讨论了如何在此应用贝叶斯优化,并提出了一种新颖的预热策略来对其进行优化。为了使我们的算法更具实用性,我们还研究了如何识别有前景的谓词属性组合。我们展示了束搜索思想如何部分解决该问题,并提出了几种技术以进一步优化它。我们在四个真实世界数据集上的实验表明,与 Featuretools 和其他基线相比,FeatAug 提取的特征更为有效。代码已在 https://github.com/sfu-db/FeatAug 开源。
关键词
引用
@article{arxiv.2403.06367,
title = {FeatAug: Automatic Feature Augmentation From One-to-Many Relationship Tables},
author = {Danrui Qi and Weiling Zheng and Jiannan Wang},
journal= {arXiv preprint arXiv:2403.06367},
year = {2024}
}