面向小规模不平衡文本数据情感检测的数据增强
计算与语言
2023-10-31 v3
摘要
文本情感识别,即识别喜悦或愤怒等情感的任务,是 NLP 中一项具有众多应用的挑战性问题。挑战之一在于已标注情感的数据集匮乏。某些现有数据集规模小、遵循不同的情感分类体系,并且在其情感分布上呈现不平衡。在本工作中,我们精确研究了在数据增强技术应用于小规模不平衡数据集(当前最先进模型如 RoBERTa 在此类数据上表现不佳)时的效果。具体而言,我们在三个来源不同、规模与情感类别及分布各异的数据集上使用了四种数据增强方法(Easy Data Augmentation EDA、基于静态与上下文嵌入的方法,以及 ProtAugment)。我们的实验结果表明,在训练分类器模型时使用增强数据可带来显著提升。最后,我们进行了两项案例研究:a) 直接使用流行的 chat-GPT API 通过不同提示对文本进行改写,以及 b) 使用外部数据扩充训练集。结果显示了这些方法的良好潜力。
引用
@article{arxiv.2310.17015,
title = {Data Augmentation for Emotion Detection in Small Imbalanced Text Data},
author = {Anna Koufakou and Diego Grisales and Ragy Costa de jesus and Oscar Fox},
journal= {arXiv preprint arXiv:2310.17015},
year = {2023}
}
备注
To be published in the Proceedings of the 22nd IEEE International Conference on Machine Learning Applications (ICMLA 2023)