阿拉伯推文语篇行为分类:加权集成预训练变换模型
计算与语言
2024-02-01 v1 人工智能
摘要
语篇行为是说话者在对话中执行言语行为,如询问、推荐、问候、感谢他人、表达思想或提出建议。理解语篇行为有助于解释说话人或作者言语背后的意图和行动。本文提出了一种基于变换深度学习神经网络的推特阿拉伯语方言语篇行为分类方法。推特和社交媒体正越来越多地融入日常生活,因此已发展成为代表用户观点和态度的重要信息来源。我们提出了一种基于BERT的加权集成学习方法,用于整合各种BERT模型在阿拉伯语方言语篇行为分类中的优势。我们将提出的模型与几种阿拉伯语BERT模型和基于序列的模型进行了比较。我们通过在大型现有阿拉伯语情感分析数据集(ASAD)的子集上进行注释,开发了一个阿拉伯语推文语篇行为数据集,基于六个语篇行为类别。我们还在先前开发的阿拉伯语推文语篇行为数据集(ArSAS)上对模型进行了评估。为克服语篇行为问题中常见的类别不平衡问题,实施了基于变换的模型进行数据增强,以生成语篇行为各类别的相等比例。结果表明,最佳BERT模型为araBERTv2-Twitter模型,实现了0.73的宏平均F1得分和0.84的准确率。使用基于BERT的集成方法后,分别在我们的数据集上实现了0.74的平均F1得分和0.85的准确率。
引用
@article{arxiv.2401.17373,
title = {Arabic Tweet Act: A Weighted Ensemble Pre-Trained Transformer Model for Classifying Arabic Speech Acts on Twitter},
author = {Khadejaa Alshehri and Areej Alhothali and Nahed Alowidi},
journal= {arXiv preprint arXiv:2401.17373},
year = {2024}
}
备注
16 pages, 6 figures