中文

JUNLP@SemEval-2020 任务9:基于网格搜索交叉验证的印地语-英语混合数据情感分析

计算与语言 2020-09-03 v2

摘要

语码混合是一种主要出现在多语言社会中的现象。精通母语且同时使用英语的多语言者,倾向于在主要语言中使用基于英语的语音输入和插入英语借词来进行语码混合。这种语言现象对情感分析、机器翻译和文本摘要等传统 NLP 领域构成了巨大挑战。在本工作中,我们致力于为语码混合情感分析领域寻找一个可行的解决方案。此项工作作为参与 SemEval-2020 Sentimix 任务的一部分,我们聚焦于英语-印地语语码混合句子的情感分析。我们提交的用户名为“sainik.mahata”,团队名为“JUNLP”。我们使用特征提取算法,结合支持向量回归(SVR)和网格搜索等传统机器学习算法,尝试解决该任务。使用任务组织者准备的指标进行测试,我们的方法获得了 66.2% 的 f1 分数。

关键词

引用

@article{arxiv.2007.12561,
  title  = {JUNLP@SemEval-2020 Task 9:Sentiment Analysis of Hindi-English code mixed data using Grid Search Cross Validation},
  author = {Avishek Garain and Sainik Kumar Mahata and Dipankar Das},
  journal= {arXiv preprint arXiv:2007.12561},
  year   = {2020}
}