中文

Theedhum Nandrum@Dravidian-CodeMix-FIRE2020:面向泰米尔语、马来语拉姆语与英语码混 YouTube 评论的情感极性分类器

计算与语言 2020-10-14 v2 机器学习

摘要

Theedhum Nandrum 是一个使用两种方法的情感极性检测系统——基于随机梯度下降(SGD)的分类器和基于长短期记忆(LSTM)的分类器。我们的方法利用了语言特征,如表情符号的使用、文字系统的选择和码混,这些在指定用于 Dravidian Codemix - FIRE 2020 任务的数据集中表现得相当明显。SGD 的超参数使用 GridSearchCV 进行了调优。我们的系统在泰米尔语-英语中排名第 4,加权平均 F1 得分为 0.62,在马来语拉姆语-英语中排名第 9,得分为 0.65。在任务截止后,我们使用基于逻辑回归的模型在泰米尔语-英语上取得了 0.77 的加权平均 F1 分数。该性能大幅优于该数据集上排名最高的分类器。我们对码混数据中语言特定的 Soundex 的使用以协调拼写变体,似乎是对 Soundex 的新颖应用。我们的完整代码发布于 github:https://github.com/oligoglot/theedhum-nandrum。

关键词

引用

@article{arxiv.2010.03189,
  title  = {Theedhum Nandrum@Dravidian-CodeMix-FIRE2020: A Sentiment Polarity Classifier for YouTube Comments with Code-switching between Tamil, Malayalam and English},
  author = {BalaSundaraRaman Lakshmanan and Sanjeeth Kumar Ravindranath},
  journal= {arXiv preprint arXiv:2010.03189},
  year   = {2020}
}

备注

FIRE 2020, December 16-20, 2020, Hyderabad, India