中文

提示设计是否影响大语言模型数据插值质量?

机器学习 2025-06-05 v1 新兴技术

摘要

生成逼真的合成表格数据是机器学习中的一个关键挑战。当数据包含类别不平衡问题时,这一挑战又增加了一层复杂性。本文提出了一种新颖的 token-aware 数据插值方法,利用大语言模型的零样本学习能力。这通过结合结构化的分组式 CSV 风格提示技术和消除输入提示中无关信息来实现。我们使用两个类别不平衡的二分类数据集测试了该方法,并使用基于分类的评估指标评估插值的效果。实验结果表明,我们的方法在显著减小输入提示大小的同时,保持或提高了与基线提示相比的插值质量,特别是对于规模较小的数据集。本工作的贡献有两方面:1)揭示了在利用大语言模型进行合成数据生成时,提示设计的重要性;2)通过在计算约束条件下提供实用解决方案,解决了大语言模型在缺失数据且数据不平衡的类别数据插值中的关键空白。我们希望本工作能促进进一步的研究和讨论,探索大语言模型和提示工程技术在合成数据生成中的惊人潜力。

关键词

引用

@article{arxiv.2506.04172,
  title  = {Does Prompt Design Impact Quality of Data Imputation by LLMs?},
  author = {Shreenidhi Srinivasan and Lydia Manikonda},
  journal= {arXiv preprint arXiv:2506.04172},
  year   = {2025}
}

备注

7 pages