中文

感知差距: ASCII 艺术与重叠音频作为 CAPTCHA

密码学与安全 2026-04-07 v1

摘要

随着多模态大语言模型(LLM)的进步,传统 CAPTCHA 已无法区分人类和机器人。为此,本文旨在调查面向人类专专化神经处理的任务。我们引入两种 CAPTCHA 类型:一种基于视觉的 CAPTCHA 将字母数字字符串渲染为 ASCII 艺术,另一种基于音频的 CAPTCHA 是带有重叠或噪声破坏音频上下文的问答任务。我们对视觉 CAPTCHA 以文本和图像输入形式评估,并使用多个前沿 LLM(GPT 5.2、Gemini 3 等),评估音频 CAPTCHA 时应用背景噪声、高斯噪声和重叠语音等数据增强技术。我们确定,没有任何 LLM 能解决单个 ASCII CAPTCHA,最佳执行模型最多只能推断一个或两个字符。此外,支持音频的所有模型在解决音频 CAPTCHA 时仅略优于随机。我们的结果表明,这些 CAPTCHA 今天极其有效,但是否能抵御人工智能快速演化的环境尚不明确。后续研究需要确定这些任务是否是暂时的漏洞,或代表更持久的人类与机器人区分方法。

关键词

引用

@article{arxiv.2604.03612,
  title  = {Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA},
  author = {Choon-Hou Rafael Chong},
  journal= {arXiv preprint arXiv:2604.03612},
  year   = {2026}
}

备注

8 pages, 3 figures. Research paper proposing novel CAPTCHA methods using ASCII art and overlapping audio