Curated LLM:LLM 与数据策展的协同用于低数据场景下的表格数据增强
机器学习
2024-07-02 v3 人工智能
摘要
低数据场景下的机器学习(ML)仍是一个未被充分重视但至关重要的问题。因此,增加 ML 所需数据集样本量的数据增强方法,是释放 ML 在数据匮乏地区和领域变革潜力的关键。然而,有限的训练集限制了传统表格合成数据生成器生成 ML 任务所需的大规模且多样化增强数据集的能力。为应对这一挑战,我们引入了 CLLM,它利用大语言模型(LLM)的先验知识在低数据场景下进行数据增强。然而,如同任何生成模型一样,并非 LLM 生成的所有数据都能提升下游效用。因此,我们引入了一种基于学习动力学并结合置信度与不确定性度量的原则性策展机制,以获取高质量数据集。在实证层面,我们在多个真实世界数据集上证明了在低数据场景下 CLLM 相比传统生成器的优越性能。此外,我们深入分析了 LLM 的生成与策展机制,阐明了使其能够输出高质量增强数据集的特征。
引用
@article{arxiv.2312.12112,
title = {Curated LLM: Synergy of LLMs and Data Curation for tabular augmentation in low-data regimes},
author = {Nabeel Seedat and Nicolas Huynh and Boris van Breugel and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2312.12112},
year = {2024}
}
备注
Presented at the 41st International Conference on Machine Learning (ICML) 2024. *Seedat & Huynh contributed equally