SCOB:基于字符级监督对比学习与在线文本渲染弥合域差的通用的文本理解方法
计算机视觉与模式识别
2023-09-25 v1 人工智能
摘要
受基于语言模型(LM)的预训练巨大成功的启发,近期视觉文档理解研究探索了基于 LM 的预训练方法以建模文档图像中的文本。其中,从图像读取全部文本的预训练已显示出前景,但在应用于更广域(如同时涉及视觉文档与场景文本图像)时往往表现出不稳定性甚至失败。这对于必须处理多样域中文本图像输入的实际场景是一重大局限。本文研究了更广域中的有效预训练任务,并提出了一种名为 SCOB 的新预训练方法,其利用字符级监督对比学习与在线文本渲染,通过弥合域差来有效预训练文档与场景文本域。此外,SCOB 支持弱监督学习,显著降低了标注成本。大量基准测试表明,SCOB 普遍优于普通预训练方法,并达到与最先进方法相当的性能。我们的发现表明,SCOB 可通用且有效地服务于读取型预训练方法。代码将发布于 https://github.com/naver-ai/scob。
引用
@article{arxiv.2309.12382,
title = {SCOB: Universal Text Understanding via Character-wise Supervised Contrastive Learning with Online Text Rendering for Bridging Domain Gap},
author = {Daehee Kim and Yoonsik Kim and DongHyun Kim and Yumin Lim and Geewook Kim and Taeho Kil},
journal= {arXiv preprint arXiv:2309.12382},
year = {2023}
}
备注
ICCV 2023