中文

超越爬虫:揭示真实用户交互中的浏览器指纹识别

密码学与安全 2025-02-04 v1 人机交互

摘要

浏览器指纹识别是一种普遍存在的在线跟踪技术,越来越多地用于用户画像和定向广告。先前关于指纹识别普遍性的研究严重依赖自动化网络爬虫,而爬虫本质上难以复制人机交互的细微差别。这引发了人们对当前对真实世界指纹识别部署情况理解准确性的担忧。为此,本文展示了一项为期10周、有30名参与者参加的用户研究,该研究捕获了来自3000个顶级网站的真实浏览会话遥测数据。我们的评估显示,自动化爬虫几乎遗漏了真实用户遇到的近一半(45%)的指纹识别网站。这种差异主要源于爬虫无法访问受身份验证保护的页面、规避机器人检测以及触发由特定用户交互激活的指纹识别脚本。我们还识别出存在于真实用户数据中但自动化爬虫数据中缺失的潜在新指纹识别向量。最后,我们评估了联邦学习在真实用户数据上训练浏览器指纹识别检测模型的有效性,其性能优于仅在自动化爬虫数据上训练的模型。

关键词

引用

@article{arxiv.2502.01608,
  title  = {Beyond the Crawl: Unmasking Browser Fingerprinting in Real User Interactions},
  author = {Meenatchi Sundaram Muthu Selva Annamalai and Igor Bilogrevic and Emiliano De Cristofaro},
  journal= {arXiv preprint arXiv:2502.01608},
  year   = {2025}
}

备注

A slightly shorter version of this paper appears in the Proceedings of the 34th "The Web Conference'' (WWW 2025). Please cite the WWW version