用于近似Twitter社交连接结构的内容模型有效性评估
社会与信息网络
2016-06-01 v2
摘要
本文探讨了在Twitter用户间形成的社区结构的社会质量(优劣),其中结构内的社交链接是基于用户生成内容(语料库)的语义属性估计的。我们检验了所构建图的社区结构与基于关注关系的社交社区的重叠程度,以探明所构建链接的社会优劣。为评估作为底层社交图近似器的有效性,同时使其保持社区社会属性,我们对unigram、bigram和LDA内容模型进行了实证研究。针对在保留社交社区结构的同时预测链接这一目的,研究了不同粒度内容的影响。实验使用了跨越10个Twitter事件的100个讨论话题。unigram语言模型表现最佳,表明在联系紧密的社交社区内用词高度相似。该观察与Danescu等人(2013)提出的用词行为演化现象一致,即同一社区中的个体倾向于选择相同词汇,并且对文献中未经验证便使用LDA而非其他内容模型进行基于内容的社交链接预测的做法提出了质疑。此外,观察到语义上更细粒度的内容比粗粒度的内容更有效。
引用
@article{arxiv.1605.09338,
title = {Assessment of Effectiveness of Content Models for Approximating Twitter Social Connection Structures},
author = {Kuntal Dey and Sahil Agrawal and Rahul Malviya and Saroj Kaushik},
journal= {arXiv preprint arXiv:1605.09338},
year = {2016}
}