利用 Transformer 与相似度度量进行数据增强以改进阿拉伯语文本分类
计算与语言
2023-08-22 v3 人工智能
机器学习
摘要
学习模型的性能在很大程度上依赖于训练数据的可用性与充分性。为解决数据集充分性问题,研究者广泛探索了数据增强(DA)这一有前景的方法。DA 通过对可用数据施加变换来生成新的数据实例,从而增加数据集规模与多样性。该方法提升了模型性能与准确率,尤其在解决分类任务中的类不平衡问题时。然而,针对阿拉伯语的数据增强研究甚少,且依赖于传统方法如复述或基于加噪的技术。本文提出一种新颖的阿拉伯语 DA 方法,采用近期强大的建模技术 AraGPT-2 进行增强过程。生成的句子在上下文、语义、多样性和新颖性方面使用欧氏距离、余弦距离、Jaccard 距离和 BLEU 距离进行评估。最后,使用 AraBERT transformer 在情感分类任务上评估增强后阿拉伯语数据集的分类性能。实验在四个阿拉伯语情感数据集上进行:AraSarcasm、ASTD、ATT 和 MOVIE。所选数据集在规模、标签数量和类别不平衡程度上各异。结果显示,所提方法在所有数据集上均提升了阿拉伯语情感文本分类性能,F1 分数在 AraSarcasm 上提升 4%,在 ASTD 上提升 6%,在 ATT 上提升 9%,在 MOVIE 上提升 13%。
引用
@article{arxiv.2212.13939,
title = {Data Augmentation using Transformers and Similarity Measures for Improving Arabic Text Classification},
author = {Dania Refai and Saleh Abo-Soud and Mohammad Abdel-Rahman},
journal= {arXiv preprint arXiv:2212.13939},
year = {2023}
}
备注
15 pages, 16 Figures, this work has been submitted to the IEEE Access Journal for possible publication