中文

一种用于马拉雅拉姆语-英语代码混合的情感分析数据集

计算与语言 2021-06-09 v1

摘要

社交媒体文本多为代码混合,对其情感分析的需求日益增长。在单语数据上训练的系统因文本在不同层次混合的复杂性而在代码混合数据上失效。然而,可用于构建针对此类数据的模型的代码混合资源极少。尽管多语与跨语情感分析研究多使用半监督或无监督方法,有监督方法仍表现更优。仅有的少数数据集针对英语-西班牙语、英语-印地语和英语-汉语等流行语言。目前尚无马拉雅拉姆语-英语代码混合数据资源。本文提出一个由志愿标注者标注的马拉雅拉姆语-英语代码混合文本情感分析新黄金标准语料库。该黄金标准语料的 Krippendorff's alpha 高于 0.8。我们利用该新语料为马拉雅拉姆语-英语代码混合文本情感分析提供基准。

关键词

引用

@article{arxiv.2006.00210,
  title  = {A Sentiment Analysis Dataset for Code-Mixed Malayalam-English},
  author = {Bharathi Raja Chakravarthi and Navya Jose and Shardul Suryawanshi and Elizabeth Sherly and John P. McCrae},
  journal= {arXiv preprint arXiv:2006.00210},
  year   = {2021}
}