利用机器学习大规模增强基于规则的 DNS 审查检测
机器学习
2023-06-19 v2 人工智能
计算机与社会
网络与互联网体系结构
摘要
全球审查的蔓延导致了大量监测平台的开发,以监控和揭露审查行为。域名系统(DNS)审查是不同国家使用的一种关键机制。目前,它通过对特定目的地的 DNS 查询和响应(探测)样本应用启发式方法来检测。然而,这些启发式方法既是平台特定的,也被发现在审查者改变其封锁行为时很脆弱,因此需要一种更可靠的自动化过程来检测审查。本文中,我们探索了机器学习(ML)模型如何(1)帮助简化检测过程,(2)提高利用大规模数据集进行审查检测的潜力,以及(3)发现现有启发式方法遗漏的新审查实例和封锁签名。我们的研究表明,使用专家在已知异常和可能审查实例上导出的标签训练的监督模型,可以学习不同测量平台所使用的检测启发式方法。更关键的是,我们发现仅使用未审查实例训练的无监督模型,能够识别出现有启发式方法遗漏的新审查实例和变体。此外,两种方法都展示了发现大量新 DNS 封锁签名(即被现有启发式方法忽略的注入虚假 IP 地址)的能力。这些结果由一个重要的方法论发现支撑:比较使用相同探测但标签来自独立过程的模型输出,使我们能够在缺乏审查真实标签的情况下更可靠地检测审查案例。
引用
@article{arxiv.2302.02031,
title = {Augmenting Rule-based DNS Censorship Detection at Scale with Machine Learning},
author = {Jacob Brown and Xi Jiang and Van Tran and Arjun Nitin Bhagoji and Nguyen Phong Hoang and Nick Feamster and Prateek Mittal and Vinod Yegneswaran},
journal= {arXiv preprint arXiv:2302.02031},
year = {2023}
}
备注
To appear in Proceedings of the 29th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '23)