中文

DocAligner:通过简单拍照标注真实世界照片文档图像

计算机视觉与模式识别 2023-06-13 v2

摘要

近来,关于照片场景下文档图像分析与识别的研究兴趣日益增长。然而,这一新兴挑战缺乏标注数据集,构成了显著障碍,因为人工标注耗时且不切实际。为解决此问题,我们提出 DocAligner,一种将人工标注流程简化为拍照一步的新方法。DocAligner 通过在照片文档图像与其干净对应图像间建立稠密对应关系来实现这一点。它可将干净文档图像中已有标注自动迁移至照片文档图像,并有助于自动获取人工标注无法得到的标签。考虑到文档图像的特性,DocAligner 引入了若干创新点。首先,我们提出基于文档边缘的非刚性预对齐技术,有效消除文档图像中显著全局偏移与重复图案带来的干扰。其次,为处理大偏移并保证高精度,我们引入结合全局与局部相关层的分层对齐方法。此外,考虑到文档图像中细粒度元素的重要性,我们提出细节循环精炼模块以在高分辨率空间中增强输出。为训练 DocAligner,我们构建了合成数据集并引入自监督学习方法以增强其对真实世界数据的鲁棒性。通过大量实验,我们证明了 DocAligner 及所获取数据集的有效性。数据集与代码将公开可用。

关键词

引用

@article{arxiv.2306.05749,
  title  = {DocAligner: Annotating Real-world Photographic Document Images by Simply Taking Pictures},
  author = {Jiaxin Zhang and Bangdong Chen and Hiuyi Cheng and Fengjun Guo and Kai Ding and Lianwen Jin},
  journal= {arXiv preprint arXiv:2306.05749},
  year   = {2023}
}