中文

基于内容与上下文的顶点提名

应用统计 2012-01-20 v1 社会与信息网络 物理与社会

摘要

如果我已知少数感兴趣的人物,如何结合人类语言技术与图论来寻找其他具有相似兴趣度的人物?如果我已知少数实施犯罪的人员,如何确定其同谋?给定一组被认定为感兴趣的行动者,我们旨在寻找其他具有相似兴趣度的行动者。我们使用编码为属性图的通信集合,其中顶点代表行动者,边连接进行通信的行动者对。每条边附有一组文档,记录了该对行动者之间的通信内容,从而提供“上下文中的内容”——即在谁与谁通信的上下文中的通信主题。在这些文档中,我们已识别出的感兴趣行动者彼此之间以及与其他兴趣度未知的行动者进行通信。我们的目标是从所有兴趣度未知的顶点中提名最可能感兴趣的顶点。作为一个说明性示例,Enron 电子邮件语料库包含了行动者之间的通信,其中部分人员涉嫌欺诈。他们的一些欺诈活动被记录在电子邮件中,同时也包含许多无害的邮件(既存在于欺诈者之间,也存在于 Enron 的其他员工之间);我们已知少数欺诈者顶点的身份,并被要求提名图中其他顶点作为可能实施欺诈的其他行动者。基础理论与初步实验结果表明,采用内容与上下文的联合模型来处理此任务,其性能(以标准信息检索指标衡量)优于仅使用内容或仅使用上下文。

关键词

引用

@article{arxiv.1201.4118,
  title  = {Vertex Nomination via Content and Context},
  author = {Glen A. Coppersmith and Carey E. Priebe},
  journal= {arXiv preprint arXiv:1201.4118},
  year   = {2012}
}