中文

通过推特语料库上的语义聚类发现基本情绪集

人工智能 2013-01-07 v1 计算与语言

摘要

大量词汇被用来描述人类情绪的谱系,但究竟有多少种情绪,它们又如何相互作用?在过去的几十年里,人们提出了几种情绪理论,每种都基于一组“基本情绪”的存在,并得到包括面部表情、行为学、神经学和生理学在内的广泛研究的支持。这里我们提出的研究基于一种理论,即人们通过围绕情绪关键词使用的语言来传递他们对情绪的理解。使用一个包含超过21,000条推文的标注语料库,我们利用潜在语义聚类分析了现有文献中提出的六种基本情绪集,评估了情绪标签所附语义的独特性。我们假设,用于表达某种情绪的语言越独特,那么对该情绪的感知(包括本体感觉)就越独特,因此也就越“基本”。这使我们能够选择最能代表整个情绪谱的维度。我们发现,Ekman集(可以说是最常用于情绪分类的)在整体上语义最独特。接下来,考虑到所有被分析(即先前提出的)情绪术语,我们使用迭代潜在语义聚类算法确定了最优的语义不可约基本情绪集。我们新推导出的集合(接受、羞愧、轻蔑、感兴趣、快乐、满意、困倦、压力)比Ekman集(愤怒、厌恶、快乐、悲伤、害怕)的独特性提高了6.1%。我们还演示了如何使用潜在语义聚类数据来可视化情绪。我们引入了情绪轮廓的概念,并从视觉和数学上简要分析了复合情绪。

关键词

引用

@article{arxiv.1212.6527,
  title  = {Discovering Basic Emotion Sets via Semantic Clustering on a Twitter Corpus},
  author = {Eugene Yuta Bann},
  journal= {arXiv preprint arXiv:1212.6527},
  year   = {2013}
}

备注

University of Bath BSc(Hons) Computer Science Dissertation, 105 Pages