大语言模型时代利用音频错觉的鲁棒 CAPTCHA:从评估到改进
声音
2026-01-14 v1 计算机与社会
音频与语音处理
摘要
网站广泛使用 CAPTCHA 来阻止机器人和垃圾信息,其呈现的挑战对人类而言很容易,但对自动化程序而言却难以解决。为了提高可访问性,音频 CAPTCHA 被设计为视觉 CAPTCHA 的补充。然而,音频 CAPTCHA 针对先进的大型音频语言模型(LALM)和自动语音识别(ASR)模型的鲁棒性仍不明确。在本文中,我们引入了 AI-CAPTCHA,这是一个统一框架,提供 (i) 一个评估框架 ACEval,包含基于 LALM 和 ASR 的求解器,以及 (ii) 一种利用音频错觉的新型音频 CAPTCHA 方法 IllusionAudio。通过对七种广泛部署的音频 CAPTCHA 进行广泛评估,我们表明大多数现有方法都能被先进的 LALM 和 ASR 模型以高成功率破解,暴露了关键的安全弱点。为了解决这些漏洞,我们设计了一种新的音频 CAPTCHA 方法 IllusionAudio,该方法利用了根植于人类听觉机制的感知错觉线索。大量实验表明,我们的方法击败了所有受测试的基于 LALM 和 ASR 的攻击,同时实现了 100% 的人类通过率,显著优于现有的音频 CAPTCHA 方法。
引用
@article{arxiv.2601.08516,
title = {Robust CAPTCHA Using Audio Illusions in the Era of Large Language Models: from Evaluation to Advances},
author = {Ziqi Ding and Yunfeng Wan and Wei Song and Yi Liu and Gelei Deng and Nan Sun and Huadong Mo and Jingling Xue and Shidong Pan and Yuekang Li},
journal= {arXiv preprint arXiv:2601.08516},
year = {2026}
}