DocDjinn:使用视觉语言模型和手写扩散进行可控合成文档生成
机器学习
2026-02-26 v1
摘要
有效的文档智能模型依赖于大量的标注训练数据。然而,由于数据获取的 Labor-intensive 和成本高昂,获取足够且高质量的数据具有显著挑战。此外,利用语言模型为真实文档进行标注会引发数据隐私问题。合成文档生成作为一种具有隐私保护优势的替代方案日益涌现。我们提出 DocDjinn,一个用于可控合成文档生成的新框架,利用视觉语言模型(VLM)从无标签的种子样本生成带标注的文档。我们的方法通过聚类-based 种子选择配合参数化抽样生成符合现有源数据分布的视觉上合理且语义一致的合成文档。通过语义-视觉解耦方式引入真实感手写体和情境视觉元素,我们生成多样且高质量的带标注合成文档。我们在涵盖关键信息提取、问答、文档分类和文档布局分析等十一个基准上进行评估。鉴于 VLM 能否从无标签种子生成能有效丰富或近似真实手动标注数据的多样化文档理解任务数据集,本文首次实现了此目标。我们展示,仅凭 100 个真实训练样本,本框架在平均 的性能上达到了完整真实世界数据集的水平。我们公开发布代码和 140k+ 合成文档样本。
引用
@article{arxiv.2602.21824,
title = {DocDjinn: Controllable Synthetic Document Generation with VLMs and Handwriting Diffusion},
author = {Marcel Lamott and Saifullah Saifullah and Nauman Riaz and Yves-Noel Weweler and Tobias Alt-Veit and Ahmad Sarmad Ali and Muhammad Armaghan Shakir and Adrian Kalwa and Momina Moetesum and Andreas Dengel and Sheraz Ahmed and Faisal Shafait and Ulrich Schwanecke and Adrian Ulges},
journal= {arXiv preprint arXiv:2602.21824},
year = {2026}
}