用于泰米尔语-英语码混文本情感分析的语料库构建
计算与语言
2021-06-09 v1
摘要
理解视频或图像评论的情感在许多应用中是一项基本任务。文本情感分析可用于各类决策过程。其中一个应用是基于观众评论分析社交媒体上视频的流行情感。然而,社交媒体评论不遵循严格的语法规则,且包含多种语言混合,常以非母语文字书写。像泰米尔语这类低资源语言缺乏标注的码混数据,也增加了该问题的难度。为克服此困难,我们创建了一个包含来自 YouTube 的 15,744 条评论帖子的黄金标准泰米尔语-英语语码转换、情感标注语料库。本文描述了语料库创建与极性指派的过程。我们给出了标注者间一致性,并展示了在该语料库上训练的情感分析结果作为基准。
引用
@article{arxiv.2006.00206,
title = {Corpus Creation for Sentiment Analysis in Code-Mixed Tamil-English Text},
author = {Bharathi Raja Chakravarthi and Vigneshwaran Muralidaran and Ruba Priyadharshini and John P. McCrae},
journal= {arXiv preprint arXiv:2006.00206},
year = {2021}
}