中文

AutoML 中的 Pre-Hoc 预测:利用大语言模型提升表格数据集中的模型选择与基准测试

机器学习 2025-10-03 v1 人工智能

摘要

AutoML 在后置模型选择方面取得了显著进展,许多库能够自动识别给定数据集最佳模型。然而,这些方法通常依赖于穷举式超参数搜索,通过在目标数据集上自动训练和测试不同类型的模型。相对地,Pre-Hoc 预测作为一种有前景的替代方法,能够通过智能预选模型来规避穷举搜索。尽管其潜力巨大,但 Pre-Hoc 预测在文献中仍鲜有探讨。本文探讨了 AutoML 与 Pre-Hoc 模型选择的交叉领域,利用传统模型和大语言模型 (LLM) 代理来减少 AutoML 库的搜索空间。通过依赖数据集描述和统计信息,我们减少了 AutoML 的搜索空间。该方法应用于 AWS AutoGluon 组合数据集——这是一套包含 175 个表格分类数据集的领先 AutoML 基准数据集。该方法为 AutoML 工作流程提供了新的转向,显著降低计算开销,同时仍能为给定数据集选择最佳模型。

关键词

引用

@article{arxiv.2510.01842,
  title  = {Pre-Hoc Predictions in AutoML: Leveraging LLMs to Enhance Model Selection and Benchmarking for Tabular datasets},
  author = {Yannis Belkhiter and Seshu Tirupathi and Giulio Zizzo and Sachin Sharma and John D. Kelleher},
  journal= {arXiv preprint arXiv:2510.01842},
  year   = {2025}
}

备注

Oral Presentations ADAPT Annual Scientific Conference 2025