基于多模态对抗攻击评估 OCR 驱动的视觉文档理解的鲁棒性
计算机视觉与模式识别
2025-06-23 v1 人工智能
摘要
视觉文档理解(VDU)系统通过集成文本、布局和视觉信号实现了强大的信息提取性能。然而,其在真实场景对抗扰动下的鲁棒性仍不足以探索。我们提出首个统一框架,用于生成和评估 OCR 驱动 VDU 模型的多模态对抗攻击。该方法涵盖六种基于梯度的布局攻击情景,融合 OCR 边界框、像素和文本的操纵,跨词和行层次,布局扰动预算受约束(例如 IoU >= 0.6)以保持合理性。四个数据集(FUNSD、CORD、SROIE、DocVQA)和六个模型家族的实验结果表明,行级攻击和复合扰动(BBox + Pixel + Text)导致最严重的性能下降。基于投影梯度下降(PGD)的 BBox 扰动在所有调查模型中均优于随机位移基线。消融研究进一步验证了布局预算、文本修改和对抗迁移性的影响。
引用
@article{arxiv.2506.16407,
title = {Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks},
author = {Dong Nguyen Tien and Dung D. Le},
journal= {arXiv preprint arXiv:2506.16407},
year = {2025}
}
备注
8 pages, 1 figure, under review at EMNLP 2025