ELF-Gym:评估大型语言模型生成的表格预测特征
计算与语言
2024-10-18 v1 人工智能
机器学习
摘要
精心设计有效特征是机器学习管道中关键且耗时的任务,涉及专业领域知识。近期大型语言模型 (LLM) 的进展显示其在自动化数据科学任务方面具有潜力,包括特征工程。然而目前的评估主要基于完整机器学习管道的最终性能,无法深入洞察 LLM 在特征工程中相对于人类专家的行为差异。为填补这一空白,我们提出 ELF-Gym,用于评估 LLM 生成的特征。我们从历史 Kaggle 竞赛中构建了新数据集,包含 251 个由顶尖团队使用的“金标”特征。ELF-Gym 通过衡量生成特征对下游模型性能的影响以及其与专家设计特征在语义和功能相似性上的对齐程度,对 LLM 生成的特征进行定量评估。该方法为评估 LLM 与人类专家之间的差异提供了更全面的框架,并为 LLM 有待提升的具体领域提供了宝贵洞察。例如,使用 ELF-Gym 我们实证表明,在最佳情景下,LLM 能捕获约 56% 的金标特征,但在更严苛的实现层面,这一重叠率降至 13%。此外,在某些情况下 LLM 可能完全失败,尤其是那些需要复杂特征的数据集,表明仍有广泛的改进空间。
引用
@article{arxiv.2410.12865,
title = {ELF-Gym: Evaluating Large Language Models Generated Features for Tabular Prediction},
author = {Yanlin Zhang and Ning Li and Quan Gan and Weinan Zhang and David Wipf and Minjie Wang},
journal= {arXiv preprint arXiv:2410.12865},
year = {2024}
}