SynDoc:用于增强合成领域适应文档关键信息提取的混合判别-生成框架
计算机视觉与模式识别
2025-09-30 v1
摘要
领域特定的视觉丰富文档理解(VRDU)因文档在医疗、金融和材料科学等领域的复杂性和敏感性而面临重大挑战。现有的大型(多模态)语言模型(LLMs/MLLMs)取得了有前景的成果,但面临幻觉、领域适应不足以及依赖大量微调数据集的限制。本文引入SynDoc,一种新型框架,将判别模型和生成模型结合以解决这些挑战。SynDoc采用稳健的合成数据生成工作流程,使用结构信息提取和领域特定查询生成产生高质量注释。通过自适应指令调优,SynDoc提高了判别模型提取领域特定知识的能力。同时,采用递归推理机制迭代细化两种模型的输出,以实现稳定和准确的预测。该框架展示了可扩展、高效且精确的文档理解能力,弥合了领域特定适应与通用世界知识在文档关键信息提取任务之间的鸿沟。
引用
@article{arxiv.2509.23273,
title = {SynDoc: A Hybrid Discriminative-Generative Framework for Enhancing Synthetic Domain-Adaptive Document Key Information Extraction},
author = {Yihao Ding and Soyeon Caren Han and Yanbei Jiang and Yan Li and Zechuan Li and Yifan Peng},
journal= {arXiv preprint arXiv:2509.23273},
year = {2025}
}
备注
Work in progress