中文

基于潜在特征表示学习的网络互联网审查检测

机器学习 2023-02-28 v4 密码学与安全 网络与互联网体系结构 社会与信息网络

摘要

互联网审查是一种具有社会重要性的现象,吸引了多个学科的研究。包括 Censored Planet 在内的若干研究小组已部署大规模互联网测量平台以收集网络可达性数据。然而,现有研究通常依赖人工设计的规则(即利用审查指纹)从数据中检测基于网络的互联网审查。尽管这种基于规则的方法具有较髙的真正例检测率,但它面临若干挑战:需要人类专业知识、费力,且无法检测规则未涵盖的任何审查。为克服这些挑战,我们设计并评估了一种基于潜在特征表示学习的分类模型以及一种基于图像的分类模型来检测基于网络的互联网审查。为从网络可达性数据中推断潜在特征表示,我们提出了一种序列到序列自编码器以捕获数据中数据元素的结构与顺序。为从推断的潜在特征估计审查事件的概率,我们依赖一个稠密连接的多层神经网络模型。我们的基于图像的分类模型将一条网络可达性数据记录编码为灰度图像,并使用稠密卷积神经网络将该图像分类为受审查或不受审查。我们使用来自 Censored Planet 的数据集通过保留评估对两种方法进行比较与评估。两种分类模型均能检测基于网络的互联网审查,因为我们识别出了已知指纹未检测到的审查实例。潜在特征表示可能编码了数据中更细微的差异,因为潜在特征学习方法发现了数量更多且更多样化的新审查实例。

关键词

引用

@article{arxiv.2209.05152,
  title  = {Detecting Network-based Internet Censorship via Latent Feature Representation Learning},
  author = {Shawn P. Duncan and Hui Chen},
  journal= {arXiv preprint arXiv:2209.05152},
  year   = {2023}
}