中文

利用 GPT-2 生成合成数据以提升 NLP 机器学习分类模型的预测性能

计算与语言 2021-04-22 v1 机器学习

摘要

分类模型利用输入数据来预测后续输入数据落入预定类别的可能性。为了进行有效的分类,这些模型需要大型训练数据集。利用合成数据来提升机器学习模型的性能正成为一种常见做法。据报道,Shell 正使用合成数据构建模型以检测极少发生的问题;例如,Shell 创建了合成数据来帮助模型识别劣化的石油管线。机器学习从业者通常通过旋转、翻转和裁剪图像来生成合成数据,以增加训练卷积神经网络的图像数据量。本文旨在探索创建并利用合成 NLP 数据来改进自然语言处理机器学习分类模型的性能。在本文中,我使用了 Yelp 披萨餐厅评论数据集和迁移学习来微调预训练的 GPT-2 Transformer 模型,以生成合成披萨评论数据。随后我将此合成数据与原始真实数据结合,创建了一个新的联合数据集。该新组合模型在准确率和精确率上显著优于原始模型。

关键词

引用

@article{arxiv.2104.10658,
  title  = {Using GPT-2 to Create Synthetic Data to Improve the Prediction Performance of NLP Machine Learning Classification Models},
  author = {Dewayne Whitfield},
  journal= {arXiv preprint arXiv:2104.10658},
  year   = {2021}
}