中文

SemEval-2018 任务 2 的 Duluth UROP:基于集成学习与过采样的多语言 Emoji 预测

计算与语言 2018-05-28 v1

摘要

本文描述了参加 SemEval-2018 任务 2(多语言 Emoji 预测)的 Duluth UROP 系统。我们依赖于由使用 Naive Bayes、Logistic Regression 和 Random Forests 的分类器组成的各种集成。我们使用了 unigram 和 bigram 特征,并试图通过过采样来抵消数据的偏斜。我们的任务评估结果在英语评估的 48 个系统中排名第 19,在西班牙语评估的 21 个系统中排名第 5。评估结束后,我们意识到对预处理的一些简单更改可以显著改善我们的结果。在进行这些更改后,我们获得了在英语评估中本可排名第六、在西班牙语评估中本可排名第二的结果。

关键词

引用

@article{arxiv.1805.10267,
  title  = {Duluth UROP at SemEval-2018 Task 2: Multilingual Emoji Prediction with Ensemble Learning and Oversampling},
  author = {Shuning Jin and Ted Pedersen},
  journal= {arXiv preprint arXiv:1805.10267},
  year   = {2018}
}

备注

4 pages, to Appear in the Proceedings of the 12th International Workshop on Semantic Evaluation (SemEval 2018), June 2018, New Orleans, LA