德语Twitter情感词典生成
计算与语言
2016-11-01 v1
摘要
尽管在为英语开发新的情感词典生成(SLG)方法方面取得了实质性进展,但以合理方式将这些方法迁移到其他语言和领域的问题仍然未解决。在本文中,我们通过系统比较常见英语极性词表的半自动翻译与原始自动SLG算法(直接应用于德语数据)的结果,为该问题的解决方案做出贡献。我们在一个包含7,992条人工标注推文的语料库上评估这些词典。此外,我们还整理了基于词典和基于语料的SLG方法的结果,以找出这两种范式哪种更适合社交媒体这一固有噪声的领域。我们的实验表明,半自动翻译显著优于自动系统(达到宏平均F1分数0.589),并且基于词典的技术相比基于语料的方法产生更好的极性词表(后者的最佳F1分数分别为0.479和0.419),即使对于非标准的Twitter体裁也是如此。
引用
@article{arxiv.1610.09995,
title = {Generating Sentiment Lexicons for German Twitter},
author = {Uladzimir Sidarenka and Manfred Stede},
journal= {arXiv preprint arXiv:1610.09995},
year = {2016}
}
备注
This paper is the first in a planned series of articles on an automatic generation of sentiment lexicons for non-English Twitter. It will be presented as a poster at the PEOPLES workshop (https://peoples2016.github.io/)