CAPTURE:面向LVLM的CAPTCHA解析基准与评估
人工智能
2025-12-15 v1
摘要
受益于强大高效的多模态对齐策略,大视觉语言模型(LVLMs)能够模拟人类的视觉与推理能力,例如解决CAPTCHA。然而,基于视觉CAPTCHA的现有基准仍存在局限性。先前研究在设计基准和数据集时根据其研究目标进行了定制,因此这些基准无法全面覆盖所有CAPTCHA类型。尤其缺乏面向LVLM的专用基准。为解决这一问题,我们首次提出了一种新型CAPTCHA基准,命名为CAPTURE(CAPTCHA for Testing Under Real-world Experiments),专门面向LVLM。我们的基准涵盖来自31个厂商的4种主要CAPTCHA类型和25种子类型。这种多样性使得对LVLM性能进行多维度、全面的评估成为可能。CAPTURE具有丰富的类别多样性、大规模数据和独特的LVLM定制标签,填补了先前研究在数据全面性和标签相关性方面的空白。通过该基准评估,当前LVLM在解决CAPTCHA方面表现不佳。
引用
@article{arxiv.2512.11323,
title = {CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving},
author = {Jianyi Zhang and Ziyin Zhou and Xu Ji and Shizhao Liu and Zhangchi Zhao},
journal= {arXiv preprint arXiv:2512.11323},
year = {2025}
}