利用 GPT-2 生成合成数据以提升 NLP 机器学习分类模型的预测性能
计算与语言
2021-04-22 v1 机器学习
摘要
分类模型利用输入数据来预测后续输入数据落入预定类别的可能性。为了进行有效的分类,这些模型需要大型训练数据集。利用合成数据来提升机器学习模型的性能正成为一种常见做法。据报道,Shell 正使用合成数据构建模型以检测极少发生的问题;例如,Shell 创建了合成数据来帮助模型识别劣化的石油管线。机器学习从业者通常通过旋转、翻转和裁剪图像来生成合成数据,以增加训练卷积神经网络的图像数据量。本文旨在探索创建并利用合成 NLP 数据来改进自然语言处理机器学习分类模型的性能。在本文中,我使用了 Yelp 披萨餐厅评论数据集和迁移学习来微调预训练的 GPT-2 Transformer 模型,以生成合成披萨评论数据。随后我将此合成数据与原始真实数据结合,创建了一个新的联合数据集。该新组合模型在准确率和精确率上显著优于原始模型。
引用
@article{arxiv.2104.10658,
title = {Using GPT-2 to Create Synthetic Data to Improve the Prediction Performance of NLP Machine Learning Classification Models},
author = {Dewayne Whitfield},
journal= {arXiv preprint arXiv:2104.10658},
year = {2021}
}