通过生成式数据增强在 PubMedQA 上改进小语言模型
计算与语言
2023-08-03 v4 机器学习
摘要
大语言模型(LLMs)在自然语言处理领域取得了显著进展。然而,其不断增大的规模带来了计算成本方面的挑战。另一方面,小语言模型(SLMs)以高效著称,但它们常受限于有限的能力与训练数据,尤其在特定领域中。本文中,我们引入一种新方法,旨在利用基于 LLM 的生成式数据增强来改进医学领域中的 SLMs。我们方法的目标是开发更高效且能力更强的模型,专门适配于专业应用。通过在 PubMedQA 数据集上进行的实验,我们展示了 LLMs 在精炼和多样化现有问答对方面的有效性。这一精炼过程使得显著更小的模型在微调后性能得到提升。值得注意的是,我们最佳的 SLM 参数不足 16 亿,在 PubMedQA 数据集上优于少样本 GPT-4。我们的代码与生成的数据已公开,以促进进一步探索。
引用
@article{arxiv.2305.07804,
title = {Improving Small Language Models on PubMedQA via Generative Data Augmentation},
author = {Zhen Guo and Peiqi Wang and Yanwei Wang and Shangdi Yu},
journal= {arXiv preprint arXiv:2305.07804},
year = {2023}
}