中文

一种利用社交媒体文本属性估计社交 POI 边界的改进方法

社会与信息网络 2020-12-21 v1 人工智能 数据结构与算法 机器学习 网络与互联网体系结构

摘要

如何利用社交媒体上的文本属性进行基于密度的聚类,目前尚缺乏充分探索。本文旨在发现一种呈凸多边形形式的社交兴趣点(POI)边界。更具体地,我们提出一种基于早期社交 POI 边界估计工作(SoBEst)的新方法与算法。该 SoBEst 方法同时考虑地理区域内的相关与不相关记录,其中相关记录在其文本字段中包含 POI 名称或其变体。我们的研究受如下经验观察驱动:SoBEst 基本假设每个 POI 有一个固定的代表坐标,该坐标对某些 POI 可能远离估计出的社交 POI 边界的质心。因此,在此类情形下使用 SoBEst 可能导致边界估计质量(BEQ)不尽如人意,BEQ 表示为 FF-measure 的函数。为解决此问题,我们构建一个联合优化问题,在允许更新代表坐标 cc 的同时寻找圆的半径与 POI 的代表坐标 cc。随后,我们设计了一种迭代 SoBEst(I-SoBEst)算法,使部分 POI 达到更高程度的 BEQ。所提 I-SoBEst 算法的计算复杂度被证明随记录数线性增长。我们展示了本算法相对于包括原始 SoBEst 在内的竞争聚类方法的优越性。

关键词

引用

@article{arxiv.2012.09990,
  title  = {An Improved Approach for Estimating Social POI Boundaries With Textual Attributes on Social Media},
  author = {Cong Tran and Dung D. Vu and Won-Yong Shin},
  journal= {arXiv preprint arXiv:2012.09990},
  year   = {2020}
}

备注

13 pages, 6 figures, 5 tables; to appear in the Knowledge-Based Systems (Please cite our journal version that will appear in an upcoming issue.)