中文

我们时代的语言:标签的实证分析

社会与信息网络 2019-05-14 v1 信息检索 机器学习

摘要

在线社交网络中的标签在过去五年中获得了极大的流行。由此产生的大量数据为观察现代社会提供了新视角。此前,研究者主要依赖从 Twitter 收集的数据来研究某类标签或标签的某种属性。本文对标签分享的主要平台 Instagram 上分享的标签进行了首次大规模实证分析。我们从时间-空间维度、语义维度和社交维度三个不同维度研究标签。在总计超过 700 万标签的三个大规模数据集上进行的广泛实验提供了一系列有趣的观察。首先,我们表明标签的时间模式可分为四种不同簇,且人们在某些地点倾向于分享较少标签,在其他地点分享较多标签。其次,我们观察到不可忽略比例的标签表现出较大的语义偏移。我们证明,如所提出的标签熵所量化的那样,在用户间分享更均匀的标签更不易发生语义偏移。最后,我们提出一个二部图嵌入模型来概括用户的标签画像,并依赖这些画像进行好友预测。评估结果表明,我们的方法实现了有效预测,AUC(ROC 曲线下面积)高于 0.8,这证明了标签中蕴含的强社交信号。

关键词

引用

@article{arxiv.1905.04590,
  title  = {Language in Our Time: An Empirical Analysis of Hashtags},
  author = {Yang Zhang},
  journal= {arXiv preprint arXiv:1905.04590},
  year   = {2019}
}

备注

WWW 2019