中文

面向自动化数据科学的大语言模型:引入用于上下文感知自动特征工程的 CAAFE

人工智能 2023-10-02 v5 机器学习

摘要

随着自动化机器学习(AutoML)领域的发展,将这些系统中的领域知识纳入其中变得愈发重要。我们提出了一种利用大语言模型(LLM)来实现这一目标的方法。具体而言,我们引入了上下文感知自动特征工程(CAAFE),这是一种针对表格数据集的特征工程方法,它利用 LLM 基于数据集的描述迭代地生成额外的语义有意义特征。该方法既生成用于创建新特征的 Python 代码,也给出所生成特征实用性的解释。尽管方法在原理上简单,CAAFE 在 14 个数据集中的 11 个上提升了性能——在所有数据集上将平均 ROC AUC 性能从 0.798 提升到 0.822——类似于在我们的数据集上用随机森林替代逻辑回归所取得的提升。此外,CAAFE 通过为每个生成的特征提供文本解释而具有可解释性。CAAFE 为数据科学任务中更广泛的半自动化铺平了道路,并强调了上下文感知解决方案的重要性,其能够将 AutoML 系统的范围扩展到语义 AutoML。我们发布了我们的 \href\href{https://github.com/automl/CAAFE}{code}、一个简单的 \href\href{https://colab.research.google.com/drive/1mCA8xOAJZ4MaB_alZvyARTMjhl6RZf0a}{demo} 以及一个 \href\href{https://pypi.org/project/caafe/}{python\ package}

关键词

引用

@article{arxiv.2305.03403,
  title  = {Large Language Models for Automated Data Science: Introducing CAAFE for Context-Aware Automated Feature Engineering},
  author = {Noah Hollmann and Samuel Müller and Frank Hutter},
  journal= {arXiv preprint arXiv:2305.03403},
  year   = {2023}
}