中文

通过 ChatGPT 与数据增强提升小型语言模型性能

计算与语言 2024-09-20 v1

摘要

本文探讨了通过 ChatGPT-3.5-Turbo 进行战略性数据增强以提升小型语言模型 (SLM) 在自然语言推理 (NLI) 领域性能的可能性。通过采用基于知识蒸馏的技术和合成数据增强方法,我们旨在以无需人工标注巨大成本的方式弥合大型语言模型 (LLM) 与小型语言模型 (SLM) 之间的性能差距。我们的方法涉及两种形式的理由生成——信息抽取和知情推理——以丰富 ANLI 数据集。随后在这些增强后的数据集上对 T5-Small 进行微调,评估其性能并与既定基准进行比较。我们的发现表明,合成理由的 incorporation 显著提高了模型理解自然语言的能力,分别在 ANLI 数据集上实现了 1.3% 和 2.3% 的分类准确率提升,展示了利用 LLM 进行数据增强的潜力。该方法不仅提升了较小模型在复杂任务上的性能,还引入了一种面向小型语言模型的成本效益微调方法。通过深化对知识蒸馏和微调策略的理解,本工作为 creating 更具能力和效率的 NLP 系统的持续努力做出了贡献。

关键词

引用

@article{arxiv.2409.12599,
  title  = {Enhancing SLM via ChatGPT and Dataset Augmentation},
  author = {Tom Pieper and Mohamad Ballout and Ulf Krumnack and Gunther Heidemann and Kai-Uwe Kühnberger},
  journal= {arXiv preprint arXiv:2409.12599},
  year   = {2024}
}