使用计算语言学技术在 Twitter 数据上进行立场检测
计算与语言
2017-03-07 v1
摘要
作为人类,我们通常能从一个人的话语中察觉他或她对某个给定目标实体(话题、产品、另一个人等)是支持还是反对。但从计算机的角度看,我们需要方法来自动推断推文作者的立场,仅凭推文文本。本文展示了我们使用监督方法在 Twitter 数据上进行立场检测的结果。我们首先提取词袋特征,使用 TIMBL 进行分类,然后尝试优化特征以提高立场检测准确率,接着用两组词典——争论词典和 MPQA 主观性词典——扩展数据集;随后我们探索 MALT 解析器并利用其依存三元组构建特征,最后使用 Scikit-learn 随机森林实现进行分析。
引用
@article{arxiv.1703.02019,
title = {Performing Stance Detection on Twitter Data using Computational Linguistics Techniques},
author = {Gourav G. Shenoy and Erika H. Dsouza and Sandra Kübler},
journal= {arXiv preprint arXiv:1703.02019},
year = {2017}
}
备注
8 pages, 9 figures, 5 tables