中文

UniSent:面向 1000+ 语言的通用可适配情感词典

计算与语言 2019-12-02 v2

摘要

在本文中,我们介绍了面向 1000+1000+ 语言的 UniSent 通用情感词典。在缺乏文档级标注的情况下(这是低资源语言非常常见的场景),情感词典对于情感分析至关重要。据我们所知,就覆盖语言数量而言,UniSent 是迄今为止最大的情感资源,包括许多低资源语言。在这项工作中,我们使用大规模平行圣经语料库将情感信息从英语投影到其他语言,以用于 Twitter 数据上的情感分析。我们引入了一种称为 DomDrift 的方法,通过置信度加权方案来缓解圣经与 Twitter 之间的巨大领域失配,该方案使用领域特定嵌入来比较候选情感词在源(圣经)和目标(Twitter)领域中的最近邻。我们在有手工创建真值可用的语言子集(马其顿语、捷克语、德语、西班牙语和法语)中评估了 UniSent 的质量。我们表明,当 UniSent 用作基于嵌入表示进行词情感预测任务的情感种子时,其质量可与手工创建的情感资源相媲美。此外,我们表明,在 Twitter 领域中,仅使用 UniSent 和单语嵌入即可可靠地预测德语、西班牙语、法语和意大利语中的表情符号情感。随着本文的发表,我们发布了 UniSent 情感词典。

关键词

引用

@article{arxiv.1904.09678,
  title  = {UniSent: Universal Adaptable Sentiment Lexica for 1000+ Languages},
  author = {Ehsaneddin Asgari and Fabienne Braune and Benjamin Roth and Christoph Ringlstetter and Mohammad R. K. Mofrad},
  journal= {arXiv preprint arXiv:1904.09678},
  year   = {2019}
}