CaptchaMind:通过显式推理监督进行强化学习训练的 CAPTCHA 求解器
计算机视觉与模式识别
2026-05-20 v1 人工智能
摘要
CAPTCHA 广泛部署于人类验证机制中,频繁阻止智能代理在实际 Web 环境中完成端到端自动化。解决现代 CAPTCHA 需要强大的多步骤视觉推理和交互能力,但由于缺乏大规模训练数据和过程级标注,训练性方法始终缺失。我们引入 CaptchaBench,即第一个支持大规模训练的 CAPTCHA 基准数据集,包含 16,000 个程序生成的样本,涵盖八个任务类别,并提供详细的区域级和过程级标注。在 CaptchaBench 上进行系统评估发现,现有方法在需要精细视觉细节捕获和区域级比较的任务上持续失败。我们因此提出 CaptchaMind,一个基于强化学习的求解器,通过显式推理过程监督进行训练,在八个任务上实现 82.9% 的平均成功率,在真实场景实例上实现 71.0%,显著优于所有现有方法且无需闭源 API。
引用
@article{arxiv.2605.19538,
title = {CaptchaMind: Training CAPTCHA Solvers via Reinforcement Learning with Explicit Reasoning Supervision},
author = {Pengcheng Wang and Haoxiang Liu and Yang Dai and Xiangxiang Zeng and Guanhua Chen and Baotian Hu and Longyue Wang and Weihua Luo},
journal= {arXiv preprint arXiv:2605.19538},
year = {2026}
}
备注
17 pages, 12 figures