ArmanEmo:一个用于基于文本的情感检测的波斯语数据集
计算与语言
2022-07-26 v1 人工智能
摘要
随着近年来社交媒体平台上开放文本数据的激增,基于文本的情感检测(ED)在过去几年受到更多关注。它有许多应用,尤其对企业和在线服务提供商而言,情感检测技术可通过分析客户/用户对其产品与服务的感受来帮助他们做出明智的商业决策。在本研究中,我们介绍 ArmanEmo,一个包含超过7000条波斯语句子、标注为七类的人工标注情感数据集。该数据集采集自不同来源,包括 Twitter、Instagram 以及 Digikala(一家伊朗电商公司)评论。标签基于 Ekman 的六种基本情绪(愤怒、恐惧、快乐、憎恨、悲伤、惊奇)以及另一类别(其他)以涵盖 Ekman 模型未包含的任何其他情绪。除数据集外,我们提供了若干用于情感分类的基线模型,聚焦于 SOTA 的基于 transformer 的语言模型。我们的最佳模型在测试集上取得了75.39%的宏平均 F1 分数。此外,我们还进行了迁移学习实验,以将我们所提出数据集的泛化能力与其他波斯语情感数据集进行比较。这些实验结果表明,在现有波斯语情感数据集中,我们的数据集具有更优的泛化性。ArmanEmo 已在 https://github.com/Arman-Rayan-Sharif/arman-text-emotion 公开供非商业使用。
引用
@article{arxiv.2207.11808,
title = {ArmanEmo: A Persian Dataset for Text-based Emotion Detection},
author = {Hossein Mirzaee and Javad Peymanfard and Hamid Habibzadeh Moshtaghin and Hossein Zeinali},
journal= {arXiv preprint arXiv:2207.11808},
year = {2022}
}