中文

一种用于检测Web上基于CNAME伪装追踪的机器学习方法

密码学与安全 2020-10-01 v1 计算机与社会

摘要

各种浏览器内隐私保护技术被设计用于保护终端用户免受第三方追踪。在与这些反制措施的军备竞赛中,追踪提供者开发了一种称为基于CNAME伪装的追踪新技术,以规避屏蔽第三方cookie和请求浏览器的问题。为检测此种追踪技术,浏览器扩展需要按需DNS查询API。然而该特性仅由Firefox浏览器支持。本文提出一种基于监督机器学习的方法,在无需按需DNS查询的情况下检测基于CNAME伪装的追踪。我们的目标是检测与CNAME伪装相关追踪关联的站点与请求。我们爬取目标站点列表并存储所有带属性的HTTP/HTTPS请求。随后通过查询子域的CNAME记录并基于知名追踪过滤列表进行通配符匹配,自动标注所有实例。提取特征后,我们构建监督分类模型以区分与基于CNAME伪装追踪相关的站点和请求。评估表明所提方法优于知名追踪过滤列表:站点和请求的F1分数分别为0.790和0.885。通过分析特征排列重要性,我们证明脚本数量和XMLHttpRequest比例为检测站点的判别特征,而URL请求长度有助于检测请求。最后,我们使用2018数据集训练模型并在2020数据集上获得合理性能,以分析概念漂移,从而检测基于CNAME伪装的站点和请求。

关键词

引用

@article{arxiv.2009.14330,
  title  = {A machine learning approach for detecting CNAME cloaking-based tracking on the Web},
  author = {Ha Dao and Kensuke Fukuda},
  journal= {arXiv preprint arXiv:2009.14330},
  year   = {2020}
}

备注

This paper is going to be published in IEEE Globecom 2020