德语 Twitter 情感分析
计算与语言
2019-12-02 v1
摘要
本论文探讨了人们在德语 Twitter 上表达观点的方式,考察了自动挖掘这些情感的主流方法,并提出了优于最先进技术的新方法。为此,我引入了一个人工标注了情感、情感目标与持有者,以及极性词及其上下文修饰语的德语推文新语料库。利用这些数据,我探索了情感研究的四个主要领域:(i) 情感词典的生成,(ii) 细粒度观点挖掘,(iii) 消息级极性分类,以及 (iv) 话语感知情感分析。在第一项任务中,我比较了三类流行的词典生成方法:基于词典、基于语料库和基于词嵌入的方法,发现基于词典的系统通常比后两类生成更好的词典。除此之外,我提出了一种线性投影算法,其结果超越了众多已有的自动词典。随后,在第二项任务中,我考察了自动预测情感、来源与目标的两种常见方法:条件随机场与循环神经网络,前者模型得分更高,并通过重新定义 CRF 图结构进一步提升了结果。在处理消息级极性分类时,我并列比较了三种主要情感范式:基于词典、基于机器学习和基于深度学习系统,并尝试通过引入具有基于词典注意力的双向神经网络来统一其中的第一类与第三类。最后,为使新分类器具备话语结构感知能力,我让其分别分析每条微博的基本话语单元,并借助两种新方法——隐边际化 CRF 与递归狄利克雷过程——从其 EDU 得分推断消息的整体极性。
引用
@article{arxiv.1911.13062,
title = {Sentiment Analysis of German Twitter},
author = {Wladimir Sidorenko},
journal= {arXiv preprint arXiv:1911.13062},
year = {2019}
}
备注
Ph.D. Dissertation