SentiALG:面向阿尔及利亚语情感分析的自动语料库标注方法
计算与语言
2018-08-16 v1
摘要
数据标注是一项重要但耗时且昂贵的流程。要将文本划分为两类,我们首先需要一份良好的标注指南,明确每一类所需的判定条件。在已有文献中,恰当的数据标注所伴随的困难被低估了。本文提出一种新颖方法,用于自动构建阿尔及利亚方言(一种马格里布阿拉伯语方言)的标注情感语料库。该语料库的构建基于同样自动构建的阿尔及利亚情感词典。所提出的工作处理阿拉伯语社交媒体上两种广泛使用的书写系统:阿拉伯文与 Arabizi。该方法自动构建的情感语料库包含 8000 条消息(其中 4000 条为阿拉伯文,4000 条为 Arabizi)。在阿拉伯文与 Arabizi 测试集上分别取得了高达 72% 和 78% 的 F1-score。正在进行的工作旨在集成 Arabizi 消息的转写过程,以进一步改进所得结果。
引用
@article{arxiv.1808.05079,
title = {SentiALG: Automated Corpus Annotation for Algerian Sentiment Analysis},
author = {Imane Guellil and Ahsan Adeel and Faical Azouaou and Amir Hussain},
journal= {arXiv preprint arXiv:1808.05079},
year = {2018}
}
备注
To appear in the 9th International Conference on Brain Inspired Cognitive Systems (BICS 2018)