结合特征选择的分类技术在 Twitter 信息流意图挖掘中的研究
信息检索
2020-01-29 v1 人工智能
机器学习
机器学习
摘要
在过去十年中,社交网络成为最流行的交流与互动媒介。例如,微博服务 Twitter 拥有超过 2 亿注册用户,每日交换超过 6500 万条推文。用户通过这些推文表达其想法、观点甚至意图。大多数推文以非正式方式书写,且常为俚语,包含拼写错误与缩略词。本文研究基于文本挖掘技术、影响从 Twitter 信息流中提取用户意图的特征选择问题。首先介绍我们从抽取的 Twitter 信息流构建自有数据集的方法。随后,我们提出两种特征选择技术并接以分类。第一种技术中,我们使用信息增益作为单阶段特征选择,接以有监督分类算法。第二种技术中,我们使用基于前向特征选择算法的混合方法,其中采用两种特征选择技术并接以分类算法。我们使用四种分类算法检验这两种技术,基于自有数据集进行评估,并批判性地审视结果。
引用
@article{arxiv.2001.10380,
title = {Investigating Classification Techniques with Feature Selection For Intention Mining From Twitter Feed},
author = {Qadri Mishael and Aladdin Ayesh},
journal= {arXiv preprint arXiv:2001.10380},
year = {2020}
}
备注
24 pages, 7 figures, 6 tables, DRAFT journal paper