XED:用于情感分析与情绪检测的多语言数据集
计算与语言
2020-11-09 v2
摘要
我们介绍了 XED,一个多语言细粒度情绪数据集。该数据集由人工标注的芬兰语(25k)与英语句子(30k),以及为另外 30 种语言投影标注的数据组成,为许多低资源语言提供了新的资源。我们使用 Plutchik 核心情绪并添加中性来标注该数据集,以创建一个多标签多分类数据集。该数据集使用特定语言的 BERT 模型与 SVM 进行了仔细评估,表明 XED 与其他类似数据集表现相当,因此是情感分析与情绪检测的有用工具。
引用
@article{arxiv.2011.01612,
title = {XED: A Multilingual Dataset for Sentiment Analysis and Emotion Detection},
author = {Emily Öhman and Marc Pàmies and Kaisla Kajava and Jörg Tiedemann},
journal= {arXiv preprint arXiv:2011.01612},
year = {2020}
}
备注
Accepted at COLING 2020