中文

丰富表格数据的情境 LLM 嵌入:面向集成分类器的全面消融研究

机器学习 2024-11-07 v2 人工智能

摘要

特征工程对于优化机器学习模型性能尤其重要,特别是在表格数据分类任务中。利用自然语言处理领域的进展,本研究提出了系统化方法,通过大语言模型嵌入丰富表格数据集。我们对 diverse 数据集进行全面消融研究,评估 RoBERTa 和 GPT-2 嵌入对集成分类器(包括 Random Forest、XGBoost 和 CatBoost)的影响。结果表明,集成嵌入与传统数值和类别特征往往能提升预测性能,尤其在类别不平衡或特征和样本有限的数据集上效果显著,如 UCI Adult、Heart Disease、Titanic 和 Pima Indian Diabetes 数据集,其中 XGBoost 和 CatBoost 分类器的提升尤为显著。此外,特征重要性分析揭示,LLM 派生特征经常常在预测中排名位列最重要。本研究提供了基于嵌入的特征丰富化结构化方法,说明了其在表格数据的集成学习中的优势。

关键词

引用

@article{arxiv.2411.01645,
  title  = {Enriching Tabular Data with Contextual LLM Embeddings: A Comprehensive Ablation Study for Ensemble Classifiers},
  author = {Gjergji Kasneci and Enkelejda Kasneci},
  journal= {arXiv preprint arXiv:2411.01645},
  year   = {2024}
}