中文

数据增强提升大语言模型在食物危害与产品检测中的性能

计算与语言 2025-02-14 v1

摘要

本研究的主要目标是展示利用ChatGPT-4o-mini进行数据增强对食物危害和产品分析的影响。生成的增强数据使用ChatGPT-4o-mini生成,随后用于训练两种大语言模型:RoBERTa-base 和 Flan-T5-base。模型在测试集上进行评估。结果表明,与仅使用提供数据集相比,使用增强数据有助于在召回率、F1分数、精确率和准确率等关键指标上提升模型性能。完整的代码,包括模型训练和增强数据集,可在本仓库中找到:https://github.com/AREEG94FAHAD/food-hazard-prdouct-cls

关键词

引用

@article{arxiv.2502.08687,
  title  = {Data Augmentation to Improve Large Language Models in Food Hazard and Product Detection},
  author = {Areeg Fahad Rasheed and M. Zarkoosh and Shimam Amer Chasib and Safa F. Abbas},
  journal= {arXiv preprint arXiv:2502.08687},
  year   = {2025}
}