中文

XED:用于情感分析与情绪检测的多语言数据集

计算与语言 2020-11-09 v2

摘要

我们介绍了 XED,一个多语言细粒度情绪数据集。该数据集由人工标注的芬兰语(25k)与英语句子(30k),以及为另外 30 种语言投影标注的数据组成,为许多低资源语言提供了新的资源。我们使用 Plutchik 核心情绪并添加中性来标注该数据集,以创建一个多标签多分类数据集。该数据集使用特定语言的 BERT 模型与 SVM 进行了仔细评估,表明 XED 与其他类似数据集表现相当,因此是情感分析与情绪检测的有用工具。

关键词

引用

@article{arxiv.2011.01612,
  title  = {XED: A Multilingual Dataset for Sentiment Analysis and Emotion Detection},
  author = {Emily Öhman and Marc Pàmies and Kaisla Kajava and Jörg Tiedemann},
  journal= {arXiv preprint arXiv:2011.01612},
  year   = {2020}
}

备注

Accepted at COLING 2020