中文

FS-DAG:面向视觉丰富文档理解的少样本域适应图网络

计算机视觉与模式识别 2025-11-13 v2 人工智能 计算与语言 信息检索 机器学习

摘要

本文提出 Few Shot Domain Adapting Graph (FS-DAG),一种面向视觉丰富文档理解 (VRDU) 的少样本域适应图网络模型架构。FS-DAG 在模块化框架内利用领域特定和语言/视觉特定的 backbone,以适应多样化的文档类型,仅需少量数据。该模型对实际挑战具有鲁棒性,如处理 OCR 错误、拼写错误和领域偏移,这些都是现实部署中的关键因素。FS-DAG 参数数量不足 90M,性能卓越,适用于信息抽取 (IE) 任务中计算资源有限的复杂场景。我们通过大量实验演示了 FS-DAG 的能力,显示其在信息抽取任务上的收敛速度和性能均显著优于最先进的方法。此外,本工作还凸显了开发更小、更高效模型而不牺牲性能的持续进展。代码:https://github.com/oracle-samples/fs-dag

关键词

引用

@article{arxiv.2505.17330,
  title  = {FS-DAG: Few Shot Domain Adapting Graph Networks for Visually Rich Document Understanding},
  author = {Amit Agarwal and Srikant Panda and Kulbhushan Pachauri},
  journal= {arXiv preprint arXiv:2505.17330},
  year   = {2025}
}

备注

Proceedings of the 31st International Conference on Computational Linguistics (COLING 2025), Industry Track, pages 100-114