CorrSynth — 一种用于从 LLMs 生成多样化数据集的相关采样方法
计算与语言
2025-03-19 v1 人工智能
机器学习
摘要
大语言模型(LLMs)在零样本和少样本提示下展现了在多样任务中的卓越性能。尽管近年来其数据合成能力已被充分研究,但生成的数据存在多样性不足、对提示遵循度低、以及生成模型潜在偏见渗入数据等问题。本文针对生成高多样性数据集的挑战展开工作,在此基础上训练学生模型用于下游任务。采用解码时基于引导的方法,我们提出 CorrSynth,利用相关采样策略生成更多样且更忠实于输入提示的数据。此外,我们的方法克服了分类器引导等其他基于引导技术的复杂性缺点。通过大量实验,我们证明了该方法的有效性并证实了我们的主张。特别是,我们进行内在评估以展示多样性的提升。实验表明,CorrSynth 在四个数据集上均优于竞争基线,同时提升了学生模型指标和内在指标,显示了该方法的固有优势。
引用
@article{arxiv.2411.08553,
title = {CorrSynth -- A Correlated Sampling Method for Diverse Dataset Generation from LLMs},
author = {Suhas S Kowshik and Abhishek Divekar and Vijit Malik},
journal= {arXiv preprint arXiv:2411.08553},
year = {2025}
}
备注
Published as a main conference paper at EMNLP 2024; First two authors contributed equally