中文

贝叶斯顶点提名

统计方法学 2012-05-24 v1 应用统计 统计计算

摘要

考虑一个属性图,其顶点被标记为绿色或红色,但仅观察到少数红色顶点。其他顶点的颜色未被观测到。通常,未知的红色顶点总数很少。顶点提名问题是从未观测到的顶点中提名一个为红色。图的边集是顶点对无序集合的子集。假设每条边也被标记为绿色或红色,且所有边的颜色均已知。顶点的上下文统计量定义为与其相连的已观测红色顶点数量,其内容统计量定义为与其关联的红色边数量。假设这些统计量在顶点间相互独立,且红色顶点之间更可能存在红色边,Coppersmith 和 Priebe (2012) 提出了基于这些统计量的似然模型。在此,我们利用提出的似然函数,并为未知参数和未观测顶点颜色选择先验分布,构建了一个贝叶斯模型。从所得的后验分布中,被提名的顶点是成为红色的后验概率最高的那个。推断通过 Metropolis-within-Gibbs 算法进行,并通过模拟研究展示了性能。结果表明:(i) 贝叶斯模型的表现显著优于随机猜测;(ii) 正确提名的概率随被提名顶点为红色的后验概率增加而增加;(iii) 贝叶斯模型的表现持平或优于 Coppersmith 和 Priebe 的方法。我们提供了一个使用 Enron 邮件语料库的应用实例,其中顶点代表 Enron 员工及其关联者,已观测的红色顶点为已知欺诈者,红色边代表被视为欺诈的邮件通信,我们的目标是识别出一个最可能是欺诈者的潜在顶点。

关键词

引用

@article{arxiv.1205.5082,
  title  = {Bayesian Vertex Nomination},
  author = {Dominic S. Lee and Carey E. Priebe},
  journal= {arXiv preprint arXiv:1205.5082},
  year   = {2012}
}

备注

25 pages, 10 figures, 3 tables