中文

Fabricator:一个利用教师LLM生成带标签训练数据的开源工具包

计算与语言 2024-02-06 v2 人工智能

摘要

大多数NLP任务被建模为监督学习,因此需要带标签的训练数据来训练有效模型。然而,以足够的质量和数量人工生成此类数据众所周知是昂贵且耗时的。当前研究通过探索一种称为基于数据集生成的零样本学习的新范式来解决这一瓶颈。在此范式中,向强大的LLM提供任务描述以生成可用于训练下游NLP模型的带标签数据。例如,可提示LLM“生成500条总体情感为正的电影评论,以及另外500条为负的评论”。所生成的数据随后可用于训练一个二分类情感分类器,有效地将LLM作为教师用于较小的学生模型。通过本演示,我们介绍Fabricator,一个用于数据集生成的开源Python工具包。Fabricator实现了常用的数据集生成工作流,支持广泛的下游NLP任务(如文本分类、问答和实体识别),并与知名库集成以方便快速实验。借助Fabricator,我们旨在支持研究人员使用LLM开展可复现的数据集生成实验,并帮助从业者将该方法应用于训练下游任务模型。

关键词

引用

@article{arxiv.2309.09582,
  title  = {Fabricator: An Open Source Toolkit for Generating Labeled Training Data with Teacher LLMs},
  author = {Jonas Golde and Patrick Haller and Felix Hamborg and Julian Risch and Alan Akbik},
  journal= {arXiv preprint arXiv:2309.09582},
  year   = {2024}
}

备注

3 Figures and 2 Tables