面向社交媒体情感分析的改进土耳其语数据集的构建
计算与语言
2018-02-01 v2 信息检索
社会与信息网络
摘要
为了能够成功开展分析研究,需要一个具有多种适用于情感分析[1]、事件预测、趋势检测及其他文本挖掘应用特性的公共数据集。社交媒体上的绝大多数数据为基于文本的,且由于在实施算法前需要若干不同的处理步骤来准备数据,无法直接对这些原始数据应用机器学习流程。例如,同一单词的不同拼写错误会不必要地扩大词向量空间,从而导致算法成功率降低并增加计算能力需求。本文提出了一种基于 Hadoop[2] 的带有效拼写纠正算法的改进土耳其语数据集。所收集的数据记录在 Hadoop 分布式文件系统上,并基于文本的的数据由 MapReduce 编程模型处理。该方法适用于大规模基于文本的社交媒体数据的存储与处理。在本研究中,电影评论通过 Apache ManifoldCF (MCF)[3] 自动记录并创建了数据簇。比较了如 Levenshtein 与模糊字符串匹配等多种方法,以从所收集数据创建公共数据集。实验结果表明,所提出的可用作情感分析研究中开源数据集的算法,在拼写错误的检测与纠正上已成功执行。
引用
@article{arxiv.1801.09975,
title = {Preparation of Improved Turkish DataSet for Sentiment Analysis in Social Media},
author = {Semiha Makinist and Ibrahim Riza Hallac and Betul Ay Karakus and Galip Aydin},
journal= {arXiv preprint arXiv:1801.09975},
year = {2018}
}
备注
Presented at CMES2017