SentiPers:一个波斯语情感分析语料库
计算与语言
2021-01-05 v2
摘要
情感分析(SA)是自然语言处理、计算语言学和信息检索中的一个主要研究领域。近年来,学术界和工业界对 SA 的兴趣持续增长。此外,对于生成适当的资源和数据集的需求不断增加,特别是对于包括波斯语在内的低资源语言。这些数据集在使用有监督、半监督或无监督方法设计和开发适当的观点挖掘平台中起着重要作用。在本文中,我们概述了开发手动标注情感语料库 SentiPers 的整个过程,该语料库涵盖正式和非正式的当代书面波斯语。据我们所知,SentiPers 是一个独特的情感语料库,具有如此丰富的标注,包含文档级、句子级和实体/方面级三个不同层级(针对波斯语)。该语料库包含来自数字产品领域的超过 26000 条用户意见句子,并具有通过向任意给定句子分配特定范围内的数字来量化意见的正向或负向程度的特殊特征。此外,我们给出了语料库各组成部分的统计数据,并研究了标注者之间的一致性。最后,还将讨论我们在标注过程中面临的一些挑战。
引用
@article{arxiv.1801.07737,
title = {SentiPers: A Sentiment Analysis Corpus for Persian},
author = {Pedram Hosseini and Ali Ahmadian Ramaki and Hassan Maleki and Mansoureh Anvari and Seyed Abolghasem Mirroshandel},
journal= {arXiv preprint arXiv:1801.07737},
year = {2021}
}
备注
This work is accepted to the 3rd Conference on Computational Linguistics, Sharif University of Technology