中文

SynJAC:面向域特定扫描文档关键信息提取的合成数据驱动的联合细粒度适应与校准

计算机视觉与模式识别 2025-12-18 v2

摘要

视觉丰富文档 (VRD) 包含图表、表格和段落等元素,跨越 diverse 领域传递复杂信息。然而,从这些文档中提取关键信息仍然代价高昂,尤其是针对扫描格式且布局不一致且具有特定领域要求的文档。尽管预训练模型在理解 VRD 方面取得了进展,但其对大量标注数据进行 fine-tuning 的依赖限制了可扩展性。本文提出了 SynJAC (Synthetic-data-driven Joint-granular Adaptation and Calibration),一种用于扫描文档关键信息提取的方法。SynJAC 利用合成、机器生成的数据进行域适应,并通过校准小量手动标注数据来缓解噪声。通过整合细粒度和粗粒度文档表示学习,SynJAC 显著减少了对大量手动标注的需求,同时实现了具竞争力的性能。广泛的实验表明其在域特定和扫描 VRD 场景中的有效性。

关键词

引用

@article{arxiv.2410.01609,
  title  = {SynJAC: Synthetic-data-driven Joint-granular Adaptation and Calibration for Domain Specific Scanned Document Key Information Extraction},
  author = {Yihao Ding and Soyeon Caren Han and Zechuan Li and Hyunsuk Chung},
  journal= {arXiv preprint arXiv:2410.01609},
  year   = {2025}
}

备注

Accepted for publication in Information Fusion