面向少样本合成数据生成的嵌入驱动多样性采样
计算与语言
2025-01-28 v2
摘要
临床文本的准确分类通常需要对预训练语言模型进行微调,而由于需要高质量数据和专家标注者,这一过程成本高昂且耗时。合成数据生成提供了一种替代方案,但预训练模型可能无法捕捉临床记录的句法多样性。我们提出一种嵌入驱动方法,利用来自少量真实临床记录的多样性采样来引导大语言模型进行少样本提示,从而生成更能反映临床句法的合成文本。我们使用 CheXpert 数据集在分类任务上评估了该方法,并将其与随机少样本及零样本方法进行了比较。通过余弦相似度与图灵测试,我们的方法生成的合成记录与真实临床文本更为契合。我们的流程将达到 0.85 AUC 阈值所需的数据量减少了 40%(AUROC)与 30%(AUPRC),同时使用合成数据增强模型使 AUROC 提升了 57%、AUPRC 提升了 68%。此外,我们的合成数据效能达到真实数据的 0.9 倍,价值提升了 60%。
引用
@article{arxiv.2501.11199,
title = {Embedding-Driven Diversity Sampling to Improve Few-Shot Synthetic Data Generation},
author = {Ivan Lopez and Fateme Nateghi Haredasht and Kaitlin Caoili and Jonathan H Chen and Akshay Chaudhari},
journal= {arXiv preprint arXiv:2501.11199},
year = {2025}
}