面向自动化数据科学的大语言模型:引入用于上下文感知自动特征工程的 CAAFE
人工智能
2023-10-02 v5 机器学习
摘要
随着自动化机器学习(AutoML)领域的发展,将这些系统中的领域知识纳入其中变得愈发重要。我们提出了一种利用大语言模型(LLM)来实现这一目标的方法。具体而言,我们引入了上下文感知自动特征工程(CAAFE),这是一种针对表格数据集的特征工程方法,它利用 LLM 基于数据集的描述迭代地生成额外的语义有意义特征。该方法既生成用于创建新特征的 Python 代码,也给出所生成特征实用性的解释。尽管方法在原理上简单,CAAFE 在 14 个数据集中的 11 个上提升了性能——在所有数据集上将平均 ROC AUC 性能从 0.798 提升到 0.822——类似于在我们的数据集上用随机森林替代逻辑回归所取得的提升。此外,CAAFE 通过为每个生成的特征提供文本解释而具有可解释性。CAAFE 为数据科学任务中更广泛的半自动化铺平了道路,并强调了上下文感知解决方案的重要性,其能够将 AutoML 系统的范围扩展到语义 AutoML。我们发布了我们的 、一个简单的 以及一个 。
引用
@article{arxiv.2305.03403,
title = {Large Language Models for Automated Data Science: Introducing CAAFE for Context-Aware Automated Feature Engineering},
author = {Noah Hollmann and Samuel Müller and Frank Hutter},
journal= {arXiv preprint arXiv:2305.03403},
year = {2023}
}