中文

通过数据增强增强文档关键信息定位

计算机视觉与模式识别 2025-02-11 v1 计算与语言

摘要

视觉丰富表单文档智能与理解(VRDIU)Track B专注于文档图像中关键信息的定位。其目标是开发一种能够定位数字和手写文档中对象的方法,且仅使用数字文档进行训练。本文提出了一种简单而有效的方法,包括文档增强阶段和目标检测阶段。具体来说,我们通过模拟手写文档的外观来增强数字文档的训练集。我们的实验表明,这一流程增强了模型的泛化能力,并在竞赛中取得了高性能。

关键词

引用

@article{arxiv.2502.06132,
  title  = {Enhancing Document Key Information Localization Through Data Augmentation},
  author = {Yue Dai},
  journal= {arXiv preprint arXiv:2502.06132},
  year   = {2025}
}

备注

Accepted as a workshop paper in DOCUI-AAAI2025