中文

文本处理步骤对基于词嵌入的 Twitter 情感分类的影响

计算与语言 2020-07-28 v1 信息检索 机器学习

摘要

原始文本的处理是文本分类与情感分析的关键第一步。然而,文本处理步骤常使用现成例程与预构建词字典执行,而未针对领域、应用与上下文进行优化。本文研究了七种文本处理场景对特定文本领域(Twitter)与应用(情感分类)的影响。我们开发了基于 skip gram 的词嵌入以纳入 Twitter 口语词、表情符号与标签关键词,这些常因常规文献语料中缺失而被移除。我们的实验揭示了两个常见文本处理步骤对情感分类的负面影响:1)停用词移除;2)对词向量取平均以表示单条推文。我们提出了新的有效步骤以优化情感分类流程:1)纳入非 ASCII 表情符号字符;2)从词嵌入度量词重要性;3)将词向量聚为推文嵌入;4)开发线性可分特征空间。最佳文本处理步骤组合在对 14,640 条带三种情感标签的推文分类中取得了 88.4(+/-0.4)的最高平均曲线下面积(AUC)。从上下文驱动的词嵌入中进行词选择表明,推文中仅十个最重要词累计即达最大精度的 98% 以上。结果展示了一种数据驱动的推文分类重要词选择手段,而非使用预构建词字典。所提出的推文嵌入对若干文本处理步骤具有鲁棒性并缓解了对其的需求。

关键词

引用

@article{arxiv.2007.13027,
  title  = {Effect of Text Processing Steps on Twitter Sentiment Classification using Word Embedding},
  author = {Manar D. Samad and Nalin D. Khounviengxay and Megan A. Witherow},
  journal= {arXiv preprint arXiv:2007.13027},
  year   = {2020}
}

备注

14 pages, 3 figures, 7 tables