通过基于图的合成布局提升文档 AI 数据生成
计算与语言
2024-12-06 v1 人工智能
摘要
文档 AI 模型的开发受限于对高质量标注数据集的可获取性,这主要是由于数据隐私 concerns、稀缺性以及手动标注的高成本。传统的合成数据生成方法,如文本和图像增强,虽然有效地增加了数据多样性,但往往无法捕捉真实文档中复杂的布局结构。本文提出了一种使用图神经网络(GNN)生成合成文档布局的新方法。通过将文档元素(如文本块、图像、表格)表示为图中的节点,将其空间关系表示为边,GNN 被训练以生成真实且多样化的文档布局。该方法利用图基于的学习来确保结构连贯性和语义一致性, addresses 了传统数据增强技术的局限性。该框架在文档分类、命名实体识别(NER)和信息抽取等任务上进行了评估,显示出显著的性能提升。此外,我们解决了基于 GNN 的合成数据生成的计算挑战,并提出了解决方案来缓解合成数据与真实世界数据集之间的领域适应问题。我们的实验结果表明,图增强的文档布局在现有数据增强技术之上提供了可扩展且灵活的解决方案,用于训练文档 AI 模型。
引用
@article{arxiv.2412.03590,
title = {Enhancing Document AI Data Generation Through Graph-Based Synthetic Layouts},
author = {Amit Agarwal and Hitesh Patel and Priyaranjan Pattnayak and Srikant Panda and Bhargava Kumar and Tejaswini Kumar},
journal= {arXiv preprint arXiv:2412.03590},
year = {2024}
}
备注
Published in IJERT, Volume 13, Issue 10 (October 2024)