中文

PromptMix:一种用于大语言模型蒸馏的类边界增强方法

计算与语言 2023-10-24 v1 人工智能

摘要

数据增强是一种在训练数据有限时解决文本分类问题的广泛使用技术。近期工作常利用像 GPT3 这样的大语言模型(LLMs)来在已有样本基础上生成新样本以应对该问题。在本工作中,我们提出一种方法,通过利用 LLM 遵循指令和进行少样本分类的能力来生成更有帮助的增强数据。我们具体的 PromptMix 方法包含两步:1)在类边界附近生成具有挑战性的文本增强样本;然而,生成边界样本会增加数据集中假阳性的风险,因此我们 2)使用基于提示的 LLM 分类器对文本增强样本重新标注,以提升生成数据中标签的正确性。我们在四个文本分类数据集 Banking77、TREC6、Subjectivity (SUBJ) 和 Twitter Complaints 上具有挑战性的 2-shot 与零样本设定下评估所提方法。我们的实验表明,生成并——关键地——重新标注边界样本促进了像 GPT3.5-turbo 这样的巨型 LLM 的知识向更小更廉价的分类器如 DistilBERTbase_{base} 和 BERTbase_{base} 的迁移。此外,2-shot PromptMix 在四个数据集上优于多种 5-shot 数据增强方法。我们的代码见 https://github.com/ServiceNow/PromptMix-EMNLP-2023。

关键词

引用

@article{arxiv.2310.14192,
  title  = {PromptMix: A Class Boundary Augmentation Method for Large Language Model Distillation},
  author = {Gaurav Sahu and Olga Vechtomova and Dzmitry Bahdanau and Issam H. Laradji},
  journal= {arXiv preprint arXiv:2310.14192},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 (Long paper)