中文

仅凭大语言模型生成用户指令指定的文本分类器

计算与语言 2024-05-21 v2

摘要

本文旨在给定任意类别定义(即用户指令),生成文本分类数据,从而在无需人工标注或原始语料库的情况下训练小型文本分类器。与前人的尝试相比,我们提出的 Incubator 框架是首个能够处理复杂甚至相互依赖类别(例如"由教育者发表的 TED 演讲"与"其他")的框架。Incubator 是一个在我们从分类数据集和 HuggingFace 上的描述中获得的指令到数据映射上调谋的大语言模型,同时通过 GPT-4 进行上下文增强。我们通过在语义文本嵌入的聚类中心上进行学习来细化 Incubator,以强调生成中的一致性和语义多样性。我们将 Incubator 在各种分类任务上与强基线进行比较,包括直接的大语言模型推理和通过提示工程生成训练数据的做法。实验表明,Incubator 能够 (1) 在传统基准上表现良好, (2) 考虑标签依赖性和用户偏好, (3) 通过孵�多个分类器实现逻辑文本挖掘。

关键词

引用

@article{arxiv.2404.10877,
  title  = {Incubating Text Classifiers Following User Instruction with Nothing but LLM},
  author = {Letian Peng and Jingbo Shang},
  journal= {arXiv preprint arXiv:2404.10877},
  year   = {2024}
}