中文

基于多模态对抗攻击评估 OCR 驱动的视觉文档理解的鲁棒性

计算机视觉与模式识别 2025-06-23 v1 人工智能

摘要

视觉文档理解(VDU)系统通过集成文本、布局和视觉信号实现了强大的信息提取性能。然而,其在真实场景对抗扰动下的鲁棒性仍不足以探索。我们提出首个统一框架,用于生成和评估 OCR 驱动 VDU 模型的多模态对抗攻击。该方法涵盖六种基于梯度的布局攻击情景,融合 OCR 边界框、像素和文本的操纵,跨词和行层次,布局扰动预算受约束(例如 IoU >= 0.6)以保持合理性。四个数据集(FUNSD、CORD、SROIE、DocVQA)和六个模型家族的实验结果表明,行级攻击和复合扰动(BBox + Pixel + Text)导致最严重的性能下降。基于投影梯度下降(PGD)的 BBox 扰动在所有调查模型中均优于随机位移基线。消融研究进一步验证了布局预算、文本修改和对抗迁移性的影响。

关键词

引用

@article{arxiv.2506.16407,
  title  = {Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks},
  author = {Dong Nguyen Tien and Dung D. Le},
  journal= {arXiv preprint arXiv:2506.16407},
  year   = {2025}
}

备注

8 pages, 1 figure, under review at EMNLP 2025