中文

当视觉失效:针对 ViT 与 OCR 的文本攻击

密码学与安全 2025-10-14 v2 机器学习

摘要

基于文本的机器学习模型易受一类新兴的基于 Unicode 的对抗样本攻击,这类攻击能诱使模型误读文本,并可能造成灾难性后果。针对这些攻击的主要现有防御方法是使用光学字符识别(OCR)对潜在恶意文本输入进行预处理。理论上,OCR 模型会忽略任何恶意 Unicode 字符,并提取视觉正确的输入提供给模型。在本工作中,我们表明这些视觉防御未能阻止此类攻击。我们使用遗传算法在黑盒设定下生成视觉对抗样本(即 OCR 输出),展示了一种高度有效的新型攻击,其大幅降低了 OCR 与其他视觉模型的准确率。具体而言,我们利用 Unicode 组合字符的功能(例如 \~n 组合字符 n 和 ~)来操纵文本输入,使得文本显示时出现微小的视觉扰动。我们通过针对 Meta、Microsoft、IBM 和 Google 发布的量产模型创建对抗样本,证明了这些攻击在现实世界中的有效性。我们还进行了用户研究,以确定这些欺骗模型的对抗样本不影响人类对文本的理解,表明语言模型对此类文本攻击具有独特的脆弱性。

关键词

引用

@article{arxiv.2306.07033,
  title  = {When Vision Fails: Text Attacks Against ViT and OCR},
  author = {Nicholas Boucher and Jenny Blessing and Ilia Shumailov and Ross Anderson and Nicolas Papernot},
  journal= {arXiv preprint arXiv:2306.07033},
  year   = {2025}
}

备注

To appear in the 2nd ACM Workshop on Large AI Systems and Models with Privacy and Security Analysis