Docs2Synth:面向扫描版视觉丰富文档理解的合成数据训练检索器框架
人工智能
2026-01-21 v1
摘要
受监管领域的文档理解(VRDU)尤其具有挑战性,因为扫描文档通常包含敏感、不断演变且领域特定的知识。这导致了两个主要挑战:缺乏用于模型适配的人工标注,以及预训练模型难以跟上领域特定事实的更新。尽管多模态大语言模型(MLLMs)展现出强大的零样本能力,但它们仍然存在幻觉和领域基础不足的问题。相比之下,判别式视觉-语言预训练模型(VLPMs)提供了可靠的基础,但需要昂贵的标注来覆盖新领域。我们提出了 Docs2Synth,这是一个合成监督框架,能够为私有和低资源领域实现检索引导的推理。Docs2Synth 自动处理原始文档集合,通过基于智能体的系统生成并验证多样化的问答对,并训练一个轻量级视觉检索器来提取领域相关的证据。在推理过程中,检索器通过迭代的检索-生成循环与 MLLM 协作,减少幻觉并提高响应一致性。我们进一步将 Docs2Synth 作为一个易于使用的 Python 包提供,支持在多种真实场景中即插即用部署。在多个 VRDU 基准上的实验表明,Docs2Synth 在无需人工标注的情况下,显著增强了领域基础和领域泛化能力。
引用
@article{arxiv.2601.12260,
title = {Docs2Synth: A Synthetic Data Trained Retriever Framework for Scanned Visually Rich Documents Understanding},
author = {Yihao Ding and Qiang Sun and Puzhen Wu and Sirui Li and Siwen Luo and Wei Liu},
journal= {arXiv preprint arXiv:2601.12260},
year = {2026}
}
备注
Accepted at WWW 2026 Demo Track