中文

Do-GOOD:面向预训练视觉文档理解模型的分布偏移评估

计算机视觉与模式识别 2023-06-06 v1 计算与语言 多媒体

摘要

近来众多用于视觉文档理解(VDU)的预训练技术在广泛的文档任务上显示出性能的显著提升。然而,当测试数据分布不同于训练数据分布时,这些预训练的VDU模型无法保证持续成功。在本文中,为探究现有预训练VDU模型对各种分布偏移的鲁棒性,我们首先开发了一个称为Do-GOOD的分布外(OOD)基准,专门用于文档图像相关任务的细粒度分析。Do-GOOD基准定义了导致不同分布偏移的底层机制,并包含覆盖3项VDU相关任务(如文档信息抽取、分类和问答)的9个OOD数据集。我们随后在这些OOD数据集上评估了5个最新VDU预训练模型和2种典型OOD泛化算法的鲁棒性并进行了细粒度分析。实验结果表明,文档图像的分布内(ID)与OOD设定之间存在显著的性能差距,且对分布偏移的细粒度分析能够揭示现有预训练VDU模型与OOD泛化算法的脆弱本质。我们的Do-GOOD基准的代码与数据集可在 https://github.com/MAEHCM/Do-GOOD 获取。

关键词

引用

@article{arxiv.2306.02623,
  title  = {Do-GOOD: Towards Distribution Shift Evaluation for Pre-Trained Visual Document Understanding Models},
  author = {Jiabang He and Yi Hu and Lei Wang and Xing Xu and Ning Liu and Hui Liu and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2306.02623},
  year   = {2023}
}

备注

SIGIR 2023. The code and datasets for our Do-GOOD benchmark can be found at https://github.com/MAEHCM/Do-GOOD