中文

GoEmotions:一个细粒度情感数据集

计算与语言 2020-06-04 v2

摘要

理解语言中表达的情感具有广泛应用,从构建共情聊天机器人到检测有害的在线行为。使用具有细粒度类型学、可适应多种下游任务的大规模数据集可改进该领域的进展。我们引入 GoEmotions,最大的手动标注数据集,包含 58k 条英文 Reddit 评论,标注为 27 个情感类别或中性。我们通过主成分保留分析(Principal Preserved Component Analysis)展示标注的高质量。我们利用现有情感基准进行迁移学习实验,表明我们的数据集能很好地泛化到其他领域和不同的情感分类法。我们基于 BERT 的模型在我们提出的分类法上取得了平均 F1 分数 .46,仍有很大改进空间。

关键词

引用

@article{arxiv.2005.00547,
  title  = {GoEmotions: A Dataset of Fine-Grained Emotions},
  author = {Dorottya Demszky and Dana Movshovitz-Attias and Jeongwoo Ko and Alan Cowen and Gaurav Nemade and Sujith Ravi},
  journal= {arXiv preprint arXiv:2005.00547},
  year   = {2020}
}

备注

Accepted to ACL 2020