关系型社会数据的选择模型扩展
社会与信息网络
2020-06-18 v1
摘要
从推荐到异常检测,社交网络上的许多预测问题都可以通过将网络数据建模为关系事件序列,并利用所得模型进行预测来解决。离散选择的条件 logit 模型将关系事件建模为“选择”是一种自然的方法,其框架涵盖并扩展了诸多长期研究的网络形成模型。条件 logit 模型虽简朴,却尤为吸引人,因为它允许通过负采样进行高效一致的似然最大化,而混合 logit 及许多其他更丰富的模型则不具备此性质。负采样的价值在关系数据选择集往往极为庞大时尤为突出。鉴于负采样的重要性,本文提出一种针对混合 logit 模型的模型简化技术,称为“去混合”,即将标准的网络形成混合模型——尤其是混合局域与全局连边形成的模型——重新表述为在互不相交的选择集上运行其模式。该重构将混合 logit 模型化简为条件 logit 模型,从而开启负采样之门,同时规避了最大化混合模型似然的其他常规难题。为进一步提升可扩展性,我们还研究了用于更高效选取负样本的重要性采样,发现其可大幅加速标准与去混合模型的推断。这些步骤共同使得在极大型图中更真实地建模网络形成成为可能。我们在具有已知真值的合成数据集以及 Venmo 平台的大规模公开交易数据集上展示了我们所改进方法的相对增益。
引用
@article{arxiv.2006.10003,
title = {Scaling Choice Models of Relational Social Data},
author = {Jan Overgoor and George Pakapol Supaniratisai and Johan Ugander},
journal= {arXiv preprint arXiv:2006.10003},
year = {2020}
}