基于 Cycle-Consistent Generative Adversarial Network 对文本验证码的端到端攻击
计算机视觉与模式识别
2020-08-27 v1
摘要
作为一种广泛部署的安全方案,文本验证码变得越来越难以抵御基于机器学习的攻击。迄今为止,许多研究人员针对不同公司(如 Microsoft、Amazon 和 Apple)部署的文本验证码进行了攻击研究,并取得了一定成果。然而,这些攻击大多存在一些不足,如攻击方法可移植性差、需要一系列数据预处理步骤以及依赖大量带标签的验证码。在本文中,我们提出了一种基于 Cycle-Consistent Generative Adversarial Network 的高效简单的端到端攻击方法。与以往研究相比,我们的方法大大降低了数据标注成本。此外,该方法具有很高的可移植性。仅需修改少量配置参数即可攻击常见的文本验证码方案,这使得攻击更加容易。首先,我们基于 Cycle-GAN 训练验证码合成器以生成一些伪造样本。使用伪造数据训练基于卷积循环神经网络的基础识别器。随后,采用主动迁移学习方法,利用少量带标签的真实世界验证码样本优化基础识别器。我们的方法高效破解了 10 个热门网站部署的验证码方案,表明我们的攻击很可能具有很强的通用性。此外,我们分析了当前最流行的反识别机制。结果表明,组合更多反识别机制可以提高验证码的安全性,但提升有限。相反,生成更复杂的验证码可能会消耗更多资源并降低验证码的可用性。
引用
@article{arxiv.2008.11603,
title = {An End-to-End Attack on Text-based CAPTCHAs Based on Cycle-Consistent Generative Adversarial Network},
author = {Chunhui Li and Xingshu Chen and Haizhou Wang and Yu Zhang and Peiming Wang},
journal= {arXiv preprint arXiv:2008.11603},
year = {2020}
}