中文

基于图卷积网络的后 OCR 段落识别

计算机视觉与模式识别 2022-11-16 v6 机器学习

摘要

我们提出一种在文档图像中通过应用于 OCR 文本框上的空间图卷积网络(GCN)进行段落识别的新方法。执行行拆分与行聚类两步,以从 OCR 结果中的文本行提取段落。每步使用由边界框构建的 beta-skeleton 图,其中图边为图卷积操作提供高效支持。仅使用纯布局输入特征,GCN 模型尺寸相比基于 R-CNN 的模型小 3~4 个数量级,同时在 PubLayNet 及其他数据集上取得可比或更好的精度。此外,GCN 模型展现出从合成训练数据到真实世界图像的良好泛化能力,以及对可变文档风格的良好适应性。

关键词

引用

@article{arxiv.2101.12741,
  title  = {Post-OCR Paragraph Recognition by Graph Convolutional Networks},
  author = {Renshen Wang and Yasuhisa Fujii and Ashok C. Popat},
  journal= {arXiv preprint arXiv:2101.12741},
  year   = {2022}
}

备注

Published in WACV 2022