中文

利用生成对抗学习破解暗网文本验证码以支撑主动网络威胁情报

计算机视觉与模式识别 2022-01-19 v2

摘要

大规模自动化监控暗网(DW)平台是发展主动网络威胁情报(CTI)的第一步。尽管已有从表层网收集数据的高效方法,大规模暗网数据收集常受反爬措施阻碍。其中,文本验证码作为暗网中最普遍且最具阻碍性的反爬措施类型,通过强制用户输入难以辨识的字母数字组合来识别并封锁自动化爬虫。暗网中验证码图像经精心设计,带有额外背景噪声与可变字符长度以防范自动化破解。现有自动化验证码破解方法难以克服这些暗网挑战。因此,暗网文本验证码的求解严重依赖人工参与,耗时费力。本研究提出一种用于自动化破解暗网验证码以促进暗网数据收集的新框架。该框架包含一种新颖的生成式方法,可识别带噪声背景与可变字符长度的暗网文本验证码。为消除人工参与需求,所提框架利用生成对抗网络(GAN)抵消暗网背景噪声,并借助增强字符分割算法处理可变字符长度的验证码图像。我们提出的框架 DW-GAN 在多个暗网验证码测试平台上进行了系统评估。DW-GAN 在所有数据集上显著优于最先进基准方法,在精心收集的真实世界暗网数据集上成功率超过 94.4%。

关键词

引用

@article{arxiv.2201.02799,
  title  = {Counteracting Dark Web Text-Based CAPTCHA with Generative Adversarial Learning for Proactive Cyber Threat Intelligence},
  author = {Ning Zhang and Mohammadreza Ebrahimi and Weifeng Li and Hsinchun Chen},
  journal= {arXiv preprint arXiv:2201.02799},
  year   = {2022}
}

备注

Accepted by ACM Transactions on Management Information Systems