面向社交媒体的改进基于密度的时空文本聚类
社会与信息网络
2018-06-15 v1 人工智能
信息检索
机器学习
摘要
当输入数据类型在文本描述方面为异构时,DBSCAN可能不够充分。当我们旨在发现社交媒体上与特定兴趣点(POI)相关的带地理标签记录的聚类时,仅检查一种类型的输入数据(例如与POI相关的推文)可能由于噪声区域而描绘出不完整的聚类图景。为克服该问题,我们引入DBSTexC,一种新定义的利用时空文本信息的基于密度的聚类算法。我们首先将POI相关与POI无关的推文分别刻画为包含和不包含POI名称或其语义连贯变体的文本。通过利用POI相关与POI无关推文的比例,所提算法在分数及其变体方面展现出远高于DBSCAN的聚类性能。虽然DBSTexC在文本同质的输入下表现与DBSCAN完全相同,但在文本异构的输入下远超DBSCAN。此外,为通过充分捕捉推文的地理分布进一步提升聚类质量,我们提出模糊DBSTexC(F-DBSTexC),即DBSTexC的扩展,将模糊聚类的概念纳入DBSTexC。随后我们通过大量实验证明了F-DBSTexC的鲁棒性。我们还从解析与数值两方面展示了算法的计算复杂度。
引用
@article{arxiv.1806.05522,
title = {Improved Density-Based Spatio--Textual Clustering on Social Media},
author = {Minh D. Nguyen and Won-Yong Shin},
journal= {arXiv preprint arXiv:1806.05522},
year = {2018}
}
备注
14 pages, 10 figures, 6 tables, Submitted for publication to the IEEE Transactions on Knowledge and Data Engineering