所在即身份:基于统计匹配的用户识别
机器学习
2015-12-10 v1 密码学与安全
社会与信息网络
应用统计
机器学习
摘要
在线服务的大多数用户具有独特的行为或使用模式。这些行为模式可被利用,仅通过观测行为模式来识别和追踪用户。我们研究从行为模式统计中识别用户的任务。具体而言,我们关注如下设定:给定在两次不同实验中收集的用户数据的直方图。我们假设,在第一个数据集中,用户身份被匿名化或隐藏,而在第二个数据集中,其身份已知。我们研究通过匹配第一个数据集中用户数据直方图与第二个数据集中的直方图来识别用户的任务。在近期工作中,引入了该用户识别任务的最优算法。本文中,我们在三种不同类型的数据集和多种场景下评估该方法的有效性。使用诸如通话数据记录、网页浏览历史和GPS轨迹等数据集,我们表明给定仅有的数据直方图,很大一部分用户可被轻易识别;因此这些直方图可作为用户的指纹。我们还验证同时识别用户比逐个用户识别取得更好性能。我们展示在实际应用中,使用最优识别方法比基于启发式的方法获得更高的识别准确率。因此,该最优方法下获得的准确率可用于量化此类设定下可能的用户识别最大水平。我们表明影响最优识别算法准确率的关键因素是数据收集的时长、匿名数据集中的用户数量以及数据集的分辨率。我们分析了k-匿名化在抵御这些数据集上用户识别攻击的有效性。
引用
@article{arxiv.1512.02896,
title = {Where You Are Is Who You Are: User Identification by Matching Statistics},
author = {Farid M. Naini and Jayakrishnan Unnikrishnan and Patrick Thiran and Martin Vetterli},
journal= {arXiv preprint arXiv:1512.02896},
year = {2015}
}