基于布局保持内容替换的合成发票生成
计算机视觉与模式识别
2025-08-07 v1
摘要
自动化发票处理的机器学习模型性能严重依赖于大规模且多样化的数据集。然而,由于隐私法规和手动标注成本的限制,这类数据集的获取往往受到约束。为此,我们提出一种新颖的管道,用于生成高保真度的合成发票文档及其对应的结构化数据。该方法首先利用光学字符识别(OCR)从源发票中提取文本内容和精确的空间布局。随后替换其中一些数据字段为由大语言模型(LLM)生成的具有上下文一致性的合成内容。最后,我们采用图像填充技术擦除原始文本,并在原位置渲染新生成的合成文本,完全保留原始的布局和字体特征。此过程产生一对输出:一个视觉上逼真的新发票图像和一个与合成内容完全对应的数据文件(JSON)。我们的做法为放大小型私有数据集提供了可扩展且自动化的解决方案,使能够创建用于训练更稳健和准确的文档智能模型的大规模且多样化的语料库。
引用
@article{arxiv.2508.03754,
title = {Generating Synthetic Invoices via Layout-Preserving Content Replacement},
author = {Bevin V and Ananthakrishnan P and Ragesh KR and Sanjay M and Vineeth S and Bibin Wilson},
journal= {arXiv preprint arXiv:2508.03754},
year = {2025}
}