EPIC:基于大语言模型的表格数据分类中不平衡类数据合成的高效提示
机器学习
2025-01-15 v4 人工智能
摘要
大语言模型(LLM)在各种应用中展现出了卓越的上下文学习能力。在这项工作中,我们探讨了 LLM 在生成逼真合成表格数据方面的有效性,并确定了优化性能的关键提示设计要素。我们引入了 EPIC,这是一种新颖的方法,它利用平衡的、分组的数据样本以及一致格式与唯一变量映射,引导 LLM 为所有类别生成准确的合成数据,即使对于不平衡的数据集也是如此。在真实世界数据集上的评估表明,EPIC 实现了最先进的机器学习分类性能,并显著提高了生成效率。这些发现突出了 EPIC 在合成表格数据生成方面的有效性,特别是在解决类别不平衡问题方面。本工作的源代码可在以下网址获取:https://seharanul17.github.io/project-synthetic-tabular-llm/
引用
@article{arxiv.2404.12404,
title = {EPIC: Effective Prompting for Imbalanced-Class Data Synthesis in Tabular Data Classification via Large Language Models},
author = {Jinhee Kim and Taesung Kim and Jaegul Choo},
journal= {arXiv preprint arXiv:2404.12404},
year = {2025}
}
备注
NeurIPS 2024