中文

文档图像上的自监督表示学习

计算机视觉与模式识别 2020-05-28 v2 机器学习 图像与视频处理 机器学习

摘要

本工作分析了在文档图像分类背景下,自监督预训练对文档图像的影响。虽然先前的方法探索了自监督在自然图像上的效果,但我们表明基于块的预训练在文档图像上表现不佳,这是因为它们具有不同的结构特性和较弱的样内语义信息。我们提出了两种上下文感知的替代方案,以改进在 Tobacco-3482 图像分类任务上的性能。我们还提出了一种新颖的自监督方法,其利用文档(图像和文本)固有的多模态特性,在数据量有限的文档图像分类场景中,其性能优于其他流行的自监督方法,包括有监督的 ImageNet 预训练。

关键词

引用

@article{arxiv.2004.10605,
  title  = {Self-Supervised Representation Learning on Document Images},
  author = {Adrian Cosma and Mihai Ghidoveanu and Michael Panaitescu-Liess and Marius Popescu},
  journal= {arXiv preprint arXiv:2004.10605},
  year   = {2020}
}

备注

15 pages, 5 figures. Accepted at DAS 2020: IAPR International Workshop on Document Analysis Systems