中文

VIPER Strike:通过结构化视觉语言推理破解视觉推理 CAPTCHA

密码学与安全 2026-01-13 v1 计算机视觉与模式识别 新兴技术

摘要

视觉推理 CAPTCHA (VRC) 组合视觉场景和自然语言查询,要求对物体、属性和空间关系进行组合推理。它们正日益成为防止自动机器人攻击的首要防御。现有求解器分为两大范式:视觉中心派系依赖特定模板的检测器,但在新布局上失效;推理中心派系利用 LLM,但在细粒度视觉感知方面吃力。两者都缺乏处理多样化 VRC 部署所需的通用性。我们提出了 ViPer,一个统一的攻击框架,将结构化多对象视觉感知与自适应 LLM 推理集成。ViPer 解析视觉布局,将属性 grounding 到问题语义,并在模块化管道中推断目标坐标。我们在六大主要 VRC 提供商(VTT、Geetest、NetEase、Dingxiang、Shumei、Xiaodun)上进行评估,ViPer 实现了最高 93.2% 的成功率,接近人类水平性能。与先前求解器(GraphNet(83.2%)、Oedipus(65.8%) 和综合方法(89.5%))相比,ViPer 在所有基准上均表现出色。该框架进一步保持了对替代 LLM 主干(GPT、Grok、DeepSeek、Kimi)的鲁棒性,准确率始终保持在 90% 以上。为anticipate 防御,我们进一步引入了模板空间随机化 (TSR),一种轻量级策略对语言模板进行扰动而不改变任务语义。TSR 可显著降低求解器(即攻击者)的性能。我们的设计建议了人类可解但机器难以解答的 CAPTCHA 方向。

关键词

引用

@article{arxiv.2601.06461,
  title  = {VIPER Strike: Defeating Visual Reasoning CAPTCHAs via Structured Vision-Language Inference},
  author = {Minfeng Qi and Dongyang He and Qin Wang and Lefeng Zhang},
  journal= {arXiv preprint arXiv:2601.06461},
  year   = {2026}
}

备注

Accepted by Usenix Security 2026