ArPanEmo:面向COVID-19疫情期间阿拉伯语在线内容细粒度情感识别的开源数据集
计算与语言
2023-05-30 v1
摘要
情感识别是自然语言处理(NLP)中的一项关键任务,使机器能够理解文本中所传达的情感。情感识别的应用广泛,包括心理健康诊断、学生支持以及在线可疑行为检测。尽管关于多种语言情感识别的文献相当丰富,阿拉伯语情感识别受到的关注相对较少,导致情感标注语料库稀缺。本文提出ArPanEmo数据集,一个用于阿拉伯语在线帖子细粒度情感识别的新数据集。该数据集包含11,128条在线帖子,人工标注为十种情感类别或中性,Fleiss' kappa为0.71。它针对特定阿拉伯语方言并涉及COVID-19大流行相关话题,是同类中首个也是规模最大的数据集。我们利用Python包从三个来源收集2020年3月至2022年3月间与COVID-19大流行相关的在线帖子:Twitter、YouTube和在线新闻评论。收集完成后,每条帖子先使用情感相关术语词典进行半自动分类,判断其属于中性还是情感类。随后进行人工标注,将情感数据进一步归类为细粒度情感类别。
引用
@article{arxiv.2305.17580,
title = {ArPanEmo: An Open-Source Dataset for Fine-Grained Emotion Recognition in Arabic Online Content during COVID-19 Pandemic},
author = {Maha Jarallah Althobaiti},
journal= {arXiv preprint arXiv:2305.17580},
year = {2023}
}