中文

BrightCookies 在 SemEval-2025 Task 9:探索数据增强用于食物危险分类

计算与语言 2025-04-30 v1

摘要

本文介绍了我们为 SemEval-2025 Task 9:食物危险检测挑战赛开发的系统。该共享任务的目标是评估用于从食品召回事件报告中对危险和产品进行双层次粒度分类的可解释分类系统。在本工作中,我们提出了文本增强技术作为提高对少数类别性能不佳问题的办法,并比较了它们对各种转换器和机器学习模型在每个类别上的效果。我们探索了三种词级数据增强技术,即同义词替换、随机词交换和情境词插入。结果表明,转换器模型倾向于获得更好的整体性能。没有三种增强技术在对危险和产品进行分类时 consistently 改善整体性能。我们观察到在使用 BERT 模型将基线与每个增强模型进行比较时,针对细粒度类别会出现统计显著的改进(P < 0.05)。与基线相比,情境词插入数据增强使对少数危险类别预测准确率提高了 6%。这表明针对少数类别的有针对性增强可以提高转换器模型的性能。

关键词

引用

@article{arxiv.2504.20703,
  title  = {BrightCookies at SemEval-2025 Task 9: Exploring Data Augmentation for Food Hazard Classification},
  author = {Foteini Papadopoulou and Osman Mutlu and Neris Özen and Bas H. M. van der Velden and Iris Hendrickx and Ali Hürriyetoğlu},
  journal= {arXiv preprint arXiv:2504.20703},
  year   = {2025}
}