通过数据增强增强文档关键信息定位
计算机视觉与模式识别
2025-02-11 v1 计算与语言
摘要
视觉丰富表单文档智能与理解(VRDIU)Track B专注于文档图像中关键信息的定位。其目标是开发一种能够定位数字和手写文档中对象的方法,且仅使用数字文档进行训练。本文提出了一种简单而有效的方法,包括文档增强阶段和目标检测阶段。具体来说,我们通过模拟手写文档的外观来增强数字文档的训练集。我们的实验表明,这一流程增强了模型的泛化能力,并在竞赛中取得了高性能。
引用
@article{arxiv.2502.06132,
title = {Enhancing Document Key Information Localization Through Data Augmentation},
author = {Yue Dai},
journal= {arXiv preprint arXiv:2502.06132},
year = {2025}
}
备注
Accepted as a workshop paper in DOCUI-AAAI2025