低资源环境下通过大语言模型微调的合成数据生成
计算与语言
2024-01-09 v2 机器学习
摘要
大语言模型(LLMs)的上下文学习能力使其能用相对少量的标注样本泛化到新颖的下游任务。然而,它们的部署需要巨大的计算资源。作为替代,较小的模型若用足够多的标注样本微调,亦可解决特定任务。但这些样本获取成本高昂。为兼顾两者优势,我们研究了通过微调后的教师 LLM 生成微调训练用的合成数据,以提升小得多的模型的下游性能。在四项文本分类与两项文本生成任务中,我们发现数据生成与标注均大幅改善了相应下游模型的性能,有时仅需原始训练集的一小部分。
引用
@article{arxiv.2310.01119,
title = {Synthetic Data Generation in Low-Resource Settings via Fine-Tuning of Large Language Models},
author = {Jean Kaddour and Qi Liu},
journal= {arXiv preprint arXiv:2310.01119},
year = {2024}
}