COGNITION:从评估到对多模态 LLM CAPTCHA 求解器的防御
密码学与安全
2026-05-13 v3 人工智能
摘要
本文研究了多模态大语言模型 (MLLMs) 如何破坏视觉 CAPTCHA 安全保证。我们识别了对手方可以廉价自动化 CAPTCHA 求解的攻击面。我们评估了 7 个领先的商业和开源 MLLMs 在 18 种真实世界 CAPTCHA 任务类型上的表现,衡量单次准确率、受限重试下的成功率、端到端延迟和每次求解成本。我们进一步分析了任务特定提示工程和 few-shot demonstration 对求解器有效性的影响。我们揭示了 MLLMs 在识别导向和低互动 CAPTCHA 任务上可靠地以人类水平的成本和延迟求解,而要求精细局部化、多步骤空间推理或跨帧一致性的任务对当前模型而言仍然显著难以完成。通过 examining MLLMs 的推理痕迹,我们研究了模型为何在特定 CAPTCHA 谜题中成功/失败的底层机制,并利用这些见解导出防御导向的指南用于选择和加强 CAPTCHA 任务。为验证这些原则,我们进行了针对脆弱 CAPTCHA 类型的案例研究。我们展示了通过 incorporating 精细局部化和隐式计数,将最先进的 MLLMs 的成功率从超过 95% 降至 0%,从而确认结构性变化可有效缓解威胁。我们总结讨论了部署 CAPTCHA 作为滥用缓解管道中使用的平台运营商的意义。
引用
@article{arxiv.2512.02318,
title = {COGNITION: From Evaluation to Defense against Multimodal LLM CAPTCHA Solvers},
author = {Junyu Wang and Changjia Zhu and Yuanbo Zhou and Lingyao Li and Xu He and Mingkui Wei and Junjie Xiong},
journal= {arXiv preprint arXiv:2512.02318},
year = {2026}
}