中文

结合特征选择的分类技术在 Twitter 信息流意图挖掘中的研究

信息检索 2020-01-29 v1 人工智能 机器学习 机器学习

摘要

在过去十年中,社交网络成为最流行的交流与互动媒介。例如,微博服务 Twitter 拥有超过 2 亿注册用户,每日交换超过 6500 万条推文。用户通过这些推文表达其想法、观点甚至意图。大多数推文以非正式方式书写,且常为俚语,包含拼写错误与缩略词。本文研究基于文本挖掘技术、影响从 Twitter 信息流中提取用户意图的特征选择问题。首先介绍我们从抽取的 Twitter 信息流构建自有数据集的方法。随后,我们提出两种特征选择技术并接以分类。第一种技术中,我们使用信息增益作为单阶段特征选择,接以有监督分类算法。第二种技术中,我们使用基于前向特征选择算法的混合方法,其中采用两种特征选择技术并接以分类算法。我们使用四种分类算法检验这两种技术,基于自有数据集进行评估,并批判性地审视结果。

关键词

引用

@article{arxiv.2001.10380,
  title  = {Investigating Classification Techniques with Feature Selection For Intention Mining From Twitter Feed},
  author = {Qadri Mishael and Aladdin Ayesh},
  journal= {arXiv preprint arXiv:2001.10380},
  year   = {2020}
}

备注

24 pages, 7 figures, 6 tables, DRAFT journal paper