中文

为印度语言情感分析制备孟加拉语-英语码混语料库

计算与语言 2018-03-13 v1

摘要

近年来,对社交用户的信息内容与情感的分析已得到相当深入的研究。多数系统仅适用于单语数据,在具有码混性质的数据上使用时失效或结果不佳。为引起关注并鼓励研究者应对此难题,我们制备了用于情感分析的带语言与极性标注的黄金标准孟加拉语-英语码混数据。本文中,我们讨论了为采集与过滤原始 Twitter 数据所构建的系统。为减少标注中的人工劳动,我们开发了结合基于规则与监督模型的混合系统,用于语言与情感标注。最终语料库由一组标注者依若干准则标注而成。所得黄金标准语料库取得了以 Kappa 值衡量的出色标注者间一致性。诸如码混指数(CMI)、码混因子(CF)等各类指标,连同语言与情感等多方面,也对语料库的码混与情感性质作了定性考察。

关键词

引用

@article{arxiv.1803.04000,
  title  = {Preparing Bengali-English Code-Mixed Corpus for Sentiment Analysis of Indian Languages},
  author = {Soumil Mandal and Sainik Kumar Mahata and Dipankar Das},
  journal= {arXiv preprint arXiv:1803.04000},
  year   = {2018}
}

备注

The 13th Workshop on Asian Language Resources (ALR), collocated with LREC 2018