SynthesizRR:通过检索增强生成多样化数据集
计算与语言
2024-11-14 v3 人工智能
机器学习
摘要
由于计算和内存限制,常希望将大型语言模型(LLM)的能力蒸馏到较小的学生模型中。对于分类任务,一种做法是通过数据集合成,即生成每个标签的示例。以往的合成方法使用零样本提示,这依赖于LLM的参数知识生成可用示例。然而,这会导致重复、对流行实体偏好以及与人类文本风格差异的问题。本文提出Synthesize by Retrieval and Refinement(SynthesizRR),通过检索增强引入数据集合成过程的多样性:随着检索片段的变化,LLM将接收不同的内容来生成其示例。我们对六个数据集的合成进行实证研究,涵盖主题分类、情感分析、语调检测和幽默等任务,要求复杂的合成策略。我们发现,SynthesizRR在词汇和语义多样性、与人类书写文本的相似性以及蒸馏性能方面,均显著优于32-shot提示和四种先前方法。我们已在 https://github.com/amazon-science/synthesizrr 上发布代码,实现整个流程。
引用
@article{arxiv.2405.10040,
title = {SynthesizRR: Generating Diverse Datasets with Retrieval Augmentation},
author = {Abhishek Divekar and Greg Durrett},
journal= {arXiv preprint arXiv:2405.10040},
year = {2024}
}
备注
Published as a main conference paper at EMNLP 2024. Code available at https://github.com/amazon-science/synthesizrr