基于新型计算框架的多类 Twitter 数据分类与地理编码
社会与信息网络
2019-08-30 v3
摘要
本研究详述了随着计算技术持续演进而提出的新型计算框架在交通数据分析方面的进展。该计算框架将融合标记潜在狄利克雷分配(L-LDA)的支持向量机(SVM)分类器与公开可用 Twitter 数据上的支撑计算策略相结合,以判定交通相关事件,从而为出行者提供可靠信息。分析方法包括利用文本分类分析推文并基于字符串相似度对位置进行地理编码。针对纽约市及其周边地区开展的案例研究证明了该分析方法的可行性。分析约 700,010 条推文以提取一周内相关交通信息。SVM 分类器从结构化数据中识别交通相关推文的准确率超过 85%。为进一步将交通相关推文分类为子类:事故、拥堵、施工、特殊事件及其他事件,使用了三种监督分类器:L-LDA、SVM 及融合 L-LDA 的 SVM。本研究结果表明,采用融合 L-LDA 的 SVM 的分析框架对来自 Twitter 的道路交通相关数据进行分类的准确率超过 98.3%,显著高于单独 L-LDA 与 SVM 所取得的准确率。
引用
@article{arxiv.1905.02916,
title = {Multi-class Twitter Data Categorization and Geocoding with a Novel Computing Framework},
author = {Sakib Mahmud Khan and Mashrur Chowdhury and Linh B. Ngo and Amy Apon},
journal= {arXiv preprint arXiv:1905.02916},
year = {2019}
}