中文

多文档数据集预训练提升深度神经网络文本行检测性能

计算机视觉与模式识别 2021-09-20 v2

摘要

在本文中,我们引入了一个用于文档版面分析任务的全卷积网络。虽然 state-of-the-art 方法使用在自然场景图像上预训练的模型,但我们的方法 Doc-UFCN 依赖于从零开始训练的 U-shaped 模型来检测历史文档中的对象。我们将线条分割任务以及更一般的版面分析问题视为像素级分类任务,随后我们的模型输出输入图像的像素标记。我们表明 Doc-UFCN 在各种数据集上均优于 state-of-the-art 方法,并证明了不需要在自然场景图像上预训练的部分即可达到良好的结果。此外,我们表明在多个文档数据集上进行预训练可以提升性能。我们使用各种指标评估模型,以在方法之间进行公平且完整的比较。

关键词

引用

@article{arxiv.2012.14163,
  title  = {Multiple Document Datasets Pre-training Improves Text Line Detection With Deep Neural Networks},
  author = {Mélodie Boillet and Christopher Kermorvant and Thierry Paquet},
  journal= {arXiv preprint arXiv:2012.14163},
  year   = {2021}
}