中文

通过去匿名化进行链接预测:我们如何赢得 Kaggle 社交网络挑战赛

密码学与安全 2015-03-19 v1 机器学习

摘要

本文描述了由 Kaggle.com 举办的 IJCNN 2011 社交网络挑战赛的获胜方案。比赛的目标是促进现实世界链接预测的研究,数据集是通过爬取流行的 Flickr 社交照片分享网站获得的图,其中用户身份已被清除。通过使用我们自己的 Flickr 爬虫对比赛测试集的大部分进行去匿名化,我们能够有效地操纵比赛。我们的攻击代表了去匿名化在博弈机器学习竞赛中的一种新应用,并建议未来竞赛应如何改变举办方式。我们引入了一种新的基于模拟退火的加权图匹配算法,用于去匿名化的种子步骤。我们还展示了如何将去匿名化与链接预测相结合——后者对于在测试集中未去匿名化的部分上取得良好性能是必需的——例如,通过在测试集的去匿名化部分上训练预测器,并组合来自去匿名化和链接预测的概率性预测。

关键词

引用

@article{arxiv.1102.4374,
  title  = {Link Prediction by De-anonymization: How We Won the Kaggle Social Network Challenge},
  author = {Arvind Narayanan and Elaine Shi and Benjamin I. P. Rubinstein},
  journal= {arXiv preprint arXiv:1102.4374},
  year   = {2015}
}

备注

11 pages, 13 figures; submitted to IJCNN'2011