利用协变量信息从文本数据学习社交网络
应用统计
2020-10-19 v1
摘要
描述和刻画历史人物的影晌可能具有挑战性,而揭示其社会结构或许更具难度。历史社交网络分析方法可提供帮助,并可能揭示被历史学家忽视但实为有影响力的社会连接节点的人物。文本数据(如传记)可作为关于历史社交网络结构的有用信息来源,但在识别链接时也会带来挑战。局部泊松图套索(Local Poisson Graphical Lasso)模型利用文本中的共现次数来衡量人物间关系,并使用条件独立结构来建模社交网络。该结构将减少夸大“朋友的朋友”之间关系的倾向,但鉴于历史上常见名的高度普遍性,若无额外区分信息,仍可能引入错误链接。本工作中,我们扩展局部泊松图套索模型,加入(多重)惩罚结构,该结构融入协变量,对具有共享协变量信息的人物给出更高的链接概率。我们提出贪婪与贝叶斯两种方法来估计惩罚参数。我们在具有历史网络特征的模拟数据上展示结果,表明此类惩罚结构可提升以精确率与召回率衡量的网络恢复效果。我们还在生活在近代早期不列颠、针对 1500 至 1575 年时期的人物传记数据上说明了该方法。
引用
@article{arxiv.2010.08076,
title = {Learning Social Networks from Text Data using Covariate Information},
author = {Xiaoyi Yang and Nynke M. D. Niezink and Rebecca Nugent},
journal= {arXiv preprint arXiv:2010.08076},
year = {2020}
}